AI AI工具情报站
国内AI动态 ai-products

腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子

📰 LMSYS:Blog(Chatbot Arena 团队) 📅 2026-08-06

核心亮点

腾讯混元团队近期将自研高性能算子库 HPC-Ops 正式开源,并成功合入大模型推理框架 SGLang 的主分支。这次开源最引人注目的是动态注意力(Dynamic Attention)与融合 MoE(Fused MoE)两类算子,在自家 Hy3 模型上实测最高把 TPOT(每输出 token 耗时)压低了 48.8%。这意味着在线推理的端到端延迟几乎减半,对生产级服务而言不是小修小补,而是实打实的体验跃升,尤其利好需要实时响应的对话与搜索场景。

具体能力或事件经过

HPC-Ops 并非零散的实验代码,而是一套面向大规模部署的工具集合。除了上述两类核心算子,它还配套提供了 Router GEMM 等高性能算子,覆盖了主流 MoE 架构在路由计算和注意力计算上的关键瓶颈。项目以开源形式发布,开发者无需维护私有分支,可以直接拉取并在 SGLang 环境中复现收益,大大降低了把底层优化真正用起来的门槛,也让社区能够参与共建与二次优化。

技术细节

动态注意力(Dynamic Attention)针对变长序列做了专门优化,剔除了 padding 与无关位置上的无效计算,让长上下文场景下的算力花在刀刃上;融合 MoE(Fused MoE)把专家路由与矩阵乘 fused 到单个 kernel,显著减少了 GPU 显存来回搬运的开销。Router GEMM 则进一步加速门控权重与输入的乘加过程,避免多次 kernel 启动的额外损耗。三者叠加,在 Hy3 这种参数规模较大的混合专家模型上,端到端每 token 生成时间明显下降,且随批大小与序列长度增加,收益往往更明显。

与竞品对比

相较于社区中常见的独立注意力或朴素 MoE 实现,HPC-Ops 的优势在于“算子级”而非“框架级”的打磨,直接瞄准 TPOT 这一最影响用户体验的指标。合入 SGLang 主分支后,它比单纯堆硬件或换框架更轻量,也更容易被现有推理栈吸收,运维改动极小,对已经采用 SGLang 的团队几乎是零成本升级。

行业影响或适用场景

说白了,这套算子让中小团队也能用较低成本跑起高吞吐的生产级推理服务,尤其在客服、实时助手、交互式 copilot 等延迟敏感场景价值明显。开源也利于国内大模型生态补齐底层算子短板,缩小与头部闭源栈在基础设施层的差距,并可能催生更多基于算子级优化的下游创新。