返回 AI 情报
技巧精选 622026-08-14 12:00百灵大模型公众号:蚂蚁百灵(Ling)

蚂蚁百灵与 ASystem 团队打通单机 Agentic RL 后训练闭环

从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环

精选理由

真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。

AI 摘要

蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。

正文 · AI 翻译

公众号正文需在微信内阅读,站内仅提供摘要。

> 站内仅提供摘要,全文见原文。

原文

Original Title

从跑起来到训起来:Ling-3.0-tiny × ASystem AReno,打通单机 Agentic RL 闭环

Source

公众号:蚂蚁百灵(Ling)

Site

mp.weixin.qq.com

Author

百灵大模型

Published

2026-08-14 12:00

阅读原文· mp.weixin.qq.com

继续阅读