AI AI工具情报站
国内AI动态 ai-products

SGLang 和 Miles 为月之暗面 2.8T 参数 Kimi K3 模型提供发布当日支持

📰 LMSYS:Blog(Chatbot Arena 团队) 📅 2026-07-27

核心亮点

SGLang 与 Miles 在月之暗面 Kimi K3 发布当天就宣布提供完整支持,分别承接推理部署与强化学习训练两条关键链路。对一个刚发布的开源权重大模型而言,这种“发布即可用”的速度相当罕见,说明国内推理与训练框架已经能跟上前沿模型的迭代节奏。发布即适配带来的最大好处,是社区不必再等上几周才能开始尝鲜,研究者和工程师能在模型亮相的当天就把权重拉下来跑通流程。

具体能力或事件经过

Kimi K3 是月之暗面推出的开源权重 2.8T 参数模型。发布当天,SGLang 就实现了高效推理支持,Miles 则同步补齐了 RL 训练侧的能力。换句话说,开发者在模型亮相的第一时间,就能在 SGLang 上跑起推理、在 Miles 上做强化学习微调,而不必等待社区事后补丁。这种当日支持背后,是双方在发布前的紧密协同与早期适配,而不是临阵磨枪;这也意味着第三方教程、适配器和企业试点都可以提前备好,权重一落地,整条链路就已经就绪。

技术细节

K3 的架构很有意思:它采用 69 层 KDA 线性注意力与 24 层 MLA 交错的混合结构,既不是纯线性注意力,也不是传统 Transformer 的稠密注意力,而是在两种机制之间做穿插。这样的设计带来直接的速度收益——在 SGLang 上,单卡 batch-1 的解码速度能达到约 113 tok/s;如果再结合推测解码,吞吐可以进一步提升到约 423 tok/s。对需要长上下文、低延迟的应用来说,这个表现相当能打,因为它直接转化为更低的单次请求成本和更跟手的交互体验。

与竞品对比

把 K3 放到同类开源权重模型里看,它的混合架构明显偏离了“堆参数、上稠密”的常规路线。线性注意力负责把长序列的计算压下来,MLA 负责保住关键信息的表达能力,两者交错让模型在参数规模惊人的同时,单卡推理依旧可用。相比那些必须靠昂贵集群才能跑起来的稠密大模型,K3 加 SGLang 的组合更贴近真实工程部署,也让中小团队有了把前沿模型真正用起来的可能。

行业影响或适用场景

说白了,发布当日支持这件事本身就是信号:国产推理与训练框架正在从“跟跑”走向“陪跑”甚至“并跑”。对企业和研究者来说,K3 的开源权重加上即开即用的框架,意味着可以用可控的成本做长上下文推理、做 RL 后训练,把前沿能力真正落到自己的业务里,而不是停在 Demo 阶段。随着越来越多的前沿模型做到发布即支持,竞争焦点也会从“能不能跑起来”转向“拿它到底能造出什么”。