返回 AI 情报
技巧精选 622026-08-14 12:00百灵大模型公众号:蚂蚁百灵(Ling)
蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环
从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环
精选理由
真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。
AI 摘要
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
正文 · AI 翻译
公众号正文需在微信内阅读,站内仅提供摘要。
> 站内仅提供摘要,全文见原文。
原文
Original Title
从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环
Source
公众号:蚂蚁百灵(Ling)
Site
mp.weixin.qq.com
Author
百灵大模型
Published
2026-08-14 12:00