lightseekorg--tokenspeed
45 行
3.0 KiB
Markdown
45 行
3.0 KiB
Markdown
<!-- WEHUB_ZH_README -->
|
||
> [!NOTE]
|
||
> 本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
|
||
> [English](./README.en.md) · [原始项目](https://github.com/lightseekorg/tokenspeed) · [上游 README](https://github.com/lightseekorg/tokenspeed/blob/HEAD/README.md)
|
||
> 原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。
|
||
|
||
<p align="center">
|
||
<img src="./assets/banner/tokenspeed-banner.png" alt="TokenSpeed:光速级的 Token 推理" width="100%" />
|
||
</p>
|
||
|
||
TokenSpeed 是一款面向 **智能体工作负载(agentic workloads)** 设计的「光速级」LLM 推理引擎,具备 TensorRT-LLM 级别的性能与 vLLM 级别的易用性。我们的目标是成为生产环境智能体工作负载中性能最强的推理引擎。
|
||
|
||
核心组件:
|
||
|
||
- **建模层(Modeling layer)**:采用 local-SPMD 设计,配合静态编译器,可根据模块边界放置注解自动生成集合通信,用户无需手写并行逻辑。
|
||
- **调度器(Scheduler)**:C++ 控制面与 Python 执行面。请求生命周期、KV 缓存归属与重叠时序编码为有限状态机,并在编译期由类型系统强制保障 KV 资源的安全复用。
|
||
- **内核(Kernels)**:可插拔的分层内核系统,提供可移植的公共 API 与集中式注册表,其中包含面向智能体工作负载、在 Blackwell 上最快的 **MLA**(Multi-head Latent Attention,多头潜注意力)实现之一。
|
||
- **入口(Entrypoint)**:集成 SMG 的 AsyncLLM,用于低开销的 CPU 侧请求处理。
|
||
|
||
## 动态
|
||
|
||
- [2026/06] 深入介绍 TokenSpeed-Kernel 的设计与优化。[[blog](https://pytorch.org/blog/lightseek-tokenspeed-kernel/)]
|
||
- [2026/05] 🚀 TokenSpeed 在 Qwen3.5-397B-A17B 上为智能体工作负载达到 580 TPS。[[blog](https://pytorch.org/blog/up-to-580tps-new-speed-record-of-qwen3-5-397b-a17b-on-gpu-for-agentic-workloads-with-tokenspeed/)]
|
||
- [2026/05] TokenSpeed 正式发布 —— 面向智能体工作负载的「光速级」LLM 推理引擎。[[blog](https://lightseek.org/blog/lightseek-tokenspeed.html)]
|
||
|
||
## 博客与演讲
|
||
|
||
如需阅读 LightSeek Foundation 的技术博客、会议演讲与工程文章,请访问 [LightSeek Blog](https://lightseek.org/blog/).
|
||
|
||
## 性能对比
|
||
|
||
<img src="./assets/perf/tokenspeed-kimi-k2.5-performance.png" alt="TokenSpeed 与 TensorRT-LLM 在智能体工作负载上的帕累托曲线对比(Kimi K2.5,B200)" width="800" margin="10px"></img>
|
||
|
||
## 文档
|
||
|
||
从这里开始:
|
||
|
||
- [文档索引](https://lightseek.org/tokenspeed/)
|
||
- [快速入门](https://lightseek.org/tokenspeed/guides/getting-started)
|
||
- [启动服务](https://lightseek.org/tokenspeed/guides/launching)
|
||
- [模型配方](https://lightseek.org/tokenspeed/recipes/models)
|
||
- [服务器参数](https://lightseek.org/tokenspeed/configuration/server)
|
||
- [兼容参数](https://lightseek.org/tokenspeed/configuration/compatible-parameters)
|
||
- [并行](https://lightseek.org/tokenspeed/serving/parallelism)
|