AI资讯ai-models
1.3B 激活参数如何进入真实任务
核心亮点
蚂蚁集团旗下百灵(Ling)团队今日开源了 Ling-3.0-tiny 模型,把“大模型也能跑在端侧”这件事又往前推了一步。这款模型总参数 7.9B,但在实际推理时只激活 1.3B 参数,属于原生混合推理架构。说白了,它用一套参数同时兼顾“快思考”和“慢思考”,既能秒回简单问题,也能在复杂任务上多花算力深想。团队还一次性放出 BF16、FP8 和 INT4 三个精度版本,让不同硬件都能用上。
具体能力或事件经过
Ling-3.0-tiny 最核心的数字是 7.9B 总参数对 1.3B 激活参数。这意味着模型把大部分权重“藏”起来,只在需要时用一小部分,既保住知识容量,又把单次推理开销压了下来。三个发布版本对应不同场景:BF16 保精度,适合对效果要求高的服务器;FP8 在性能和成本间取平衡;INT4 则把模型压到最小,方便塞进显存有限的设备。开发者可以直接拉取权重,免费用于研究和产品。
技术细节
“原生混合推理”指的是推理过程本身就能在两种模式间切换,而不是靠外接规则去硬切。激活参数只有 1.3B,意味着前向计算量远低于满血 7.9B,延迟和电费都更友好。多精度发布则降低了部署门槛——同一份能力,既能上云,也能下放到边缘和移动端。
与竞品对比
和同类小模型比,Ling-3.0-tiny 的卖点不是单纯压参数,而是“总参大、激活小”的 MoE 式思路加上原生混合推理。相比之下,许多端侧模型为了省资源直接砍总参,会牺牲知识广度。蚂蚁选择开源并给多精度,也明显是想借生态换影响力。
行业影响或适用场景
这类模型最现实的落点,是企业私有化部署、手机和车机等端侧场景,以及对成本敏感的大规模调用。开源意味着中小团队不用从头训模型,就能拿到一个既能快答又能深想的底座,对推动 AI 真正下沉到日常应用很有意义。