项目文件夹

文件
wehub-resource-sync 146a92b52c
Docs / build (push) Has been cancelled
Docs / deploy (push) Has been cancelled
docs: make Chinese README the default
2026-07-13 10:22:25 +00:00

45 行
3.0 KiB
Markdown

此文件含有模棱两可的 Unicode 字符
此文件含有可能会与其他字符混淆的 Unicode 字符。 如果您是想特意这样的,可以安全地忽略该警告。 使用 Escape 按钮显示他们。
<!-- WEHUB_ZH_README -->
> [!NOTE]
> 本文档由 WeHub 基于上游 README 翻译整理,属于社区翻译,非官方中文文档。
> [English](./README.en.md) · [原始项目](https://github.com/lightseekorg/tokenspeed) · [上游 README](https://github.com/lightseekorg/tokenspeed/blob/HEAD/README.md)
> 原作者、版权与许可证归属以原始项目及本仓库 LICENSE 文件为准。
<p align="center">
<img src="./assets/banner/tokenspeed-banner.png" alt="TokenSpeed:光速级的 Token 推理" width="100%" />
</p>
TokenSpeed 是一款面向 **智能体工作负载(agentic workloads** 设计的「光速级」LLM 推理引擎,具备 TensorRT-LLM 级别的性能与 vLLM 级别的易用性。我们的目标是成为生产环境智能体工作负载中性能最强的推理引擎。
核心组件:
- **建模层(Modeling layer**:采用 local-SPMD 设计,配合静态编译器,可根据模块边界放置注解自动生成集合通信,用户无需手写并行逻辑。
- **调度器(Scheduler**C++ 控制面与 Python 执行面。请求生命周期、KV 缓存归属与重叠时序编码为有限状态机,并在编译期由类型系统强制保障 KV 资源的安全复用。
- **内核(Kernels)**:可插拔的分层内核系统,提供可移植的公共 API 与集中式注册表,其中包含面向智能体工作负载、在 Blackwell 上最快的 **MLA**Multi-head Latent Attention,多头潜注意力)实现之一。
- **入口(Entrypoint**:集成 SMG 的 AsyncLLM,用于低开销的 CPU 侧请求处理。
## 动态
- [2026/06] 深入介绍 TokenSpeed-Kernel 的设计与优化。[[blog](https://pytorch.org/blog/lightseek-tokenspeed-kernel/)]
- [2026/05] 🚀 TokenSpeed 在 Qwen3.5-397B-A17B 上为智能体工作负载达到 580 TPS。[[blog](https://pytorch.org/blog/up-to-580tps-new-speed-record-of-qwen3-5-397b-a17b-on-gpu-for-agentic-workloads-with-tokenspeed/)]
- [2026/05] TokenSpeed 正式发布 —— 面向智能体工作负载的「光速级」LLM 推理引擎。[[blog](https://lightseek.org/blog/lightseek-tokenspeed.html)]
## 博客与演讲
如需阅读 LightSeek Foundation 的技术博客、会议演讲与工程文章,请访问 [LightSeek Blog](https://lightseek.org/blog/).
## 性能对比
<img src="./assets/perf/tokenspeed-kimi-k2.5-performance.png" alt="TokenSpeed 与 TensorRT-LLM 在智能体工作负载上的帕累托曲线对比(Kimi K2.5,B200" width="800" margin="10px"></img>
## 文档
从这里开始:
- [文档索引](https://lightseek.org/tokenspeed/)
- [快速入门](https://lightseek.org/tokenspeed/guides/getting-started)
- [启动服务](https://lightseek.org/tokenspeed/guides/launching)
- [模型配方](https://lightseek.org/tokenspeed/recipes/models)
- [服务器参数](https://lightseek.org/tokenspeed/configuration/server)
- [兼容参数](https://lightseek.org/tokenspeed/configuration/compatible-parameters)
- [并行](https://lightseek.org/tokenspeed/serving/parallelism)