AI AI工具情报站
AI资讯tip

蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

公众号:蚂蚁百灵(Ling)2026-08-14T04:00:00.000Z

核心亮点

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno,在单机 DGX Spark 上跑通了"智能体强化学习(Agentic RL)后训练"的完整闭环。这件事的意义在于:过去被认为要堆集群才能做的 Agent 后训练,如今在一台机器上就能验证。它证明,哪怕资源有限,研究者也能把"让模型学会用工具、做决策"的强化学习流程跑起来,为中小团队降低了实验门槛。

具体能力或事件经过

为了验证闭环真的跑通,团队选了井字棋(tic-tac-toe)作为最小验证任务——规则简单、胜负明确、易于量化奖励。他们用 GSPO 算法训练了 400 步,观察两个关键信号:一是 rollout 的 rewards_mean(平均奖励)从约 -0.5 升到 0.4,说明模型从"常输"学到"能赢能平";二是 response_len 降到约 850 tokens,说明模型不再啰嗦,输出更聚焦。与此同时,工具调用与动作选择趋于稳定。

技术细节

所谓"Agentic RL 后训练闭环",指的是让模型在环境中不断试错、调用工具、拿到奖励、再更新参数的完整循环。Areno 在这里充当训练框架,负责把环境交互、轨迹收集与策略更新串起来;Ling-3.0-tiny 是待训练的轻量基座。GSPO 是一种策略优化算法,相比传统方法对长轨迹更稳健。DGX Spark 是单台紧凑算力设备,能在桌面级功耗下提供可观的本地算力,使"单机闭环"成为现实。

与竞品对比

当下主流的 Agent 训练多依赖大型 GPU 集群与分布式框架,门槛高、成本高。蚂蚁百灵与 ASystem 的做法,把验证成本压到一台机器,思路上更接近"平民化 RL"。与仅在静态数据上做后训练不同,他们强调"环境交互 + 奖励信号"的真实闭环,这点和许多把 agent 能力写死在提示词里的方案形成对比。说白了,他们证明了小设备也能跑通"会学"的 agent,而不只是"会答"的模型。

行业影响或适用场景

对科研与教学,这套单机闭环是极佳的入门范式:用井字棋这种小任务,就能直观看到强化学习如何让 agent 变聪明。对产业,它提示一种更省成本的 agent 迭代路径——先在单机验证算法,再上集群放大。