0 支持 NVIDIA Nemotron 3.5 Lightning
核心亮点
SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供首日支持(day-zero support),开发者发布当天即可通过 SGLang 直接部署调用。Nemotron 3.5 Lightning 是一款开源的混合专家(MoE)模型,总参数量 30B,但每次推理仅激活 3B 参数,显著降低了推理成本。
具体能力或事件经过
Nemotron 3.5 Lightning 支持最长 1M token 的超长上下文窗口,适合处理整本书籍、大型代码库或长文档摘要等任务。用户可以从 Hugging Face 直接下载 BF16 和 NVFP4 两种精度权重,灵活适配不同硬件条件。模型同时支持 MTP、DFlash、DSpark 三种投机解码(speculative decoding)技术,提升生成吞吐。
技术细节
Nemotron 3.5 Lightning 采用混合专家架构,30B 总参数中只有 3B 被激活,可单卡部署。它提供 BF16 和 NVFP4 两种权重格式,其中 NVFP4 是 NVIDIA 的 4 位浮点格式,专为 Blackwell 架构 GPU 优化,在几乎无损精度下压缩显存。三种投机解码技术分别针对不同工作负载优化,开发者可按场景自由组合。
与竞品对比
相比同级别稠密模型,Nemotron 3.5 Lightning 借助 MoE 结构在延迟和吞吐上具备明显优势。1M token 上下文也对标了当前主流长上下文模型的水平。SGLang 在发布日即完成适配,反映出 NVIDIA 与开源社区协作紧密,这种首日支持节奏通常只有头部模型才能享受,足以说明其生态优先级。
行业影响或适用场景
通过 OpenAI 兼容调用接口,Nemotron 3.5 Lightning 可以无缝接入智能体工作流,为本地化、低延迟的 AI 助手场景提供支撑。对注重数据隐私和成本控制的团队而言,开源权重加首日框架支持的组合,降低了把大模型能力落地到自有环境的门槛。