精选理由
做 agent 的人都知道环境对齐是个隐形的坑,这篇论文不仅把问题讲透了,还给了开箱即用的 wrapper,ALFWorld 上成功率从 13% 拉到 31%,原因只是改写了反馈措辞,我觉得这是今年 agent 工程最被低估的发现。
AI 摘要
面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。
正文 · AI 翻译
每个构建LLM智能体的人都在智能体的策略或更困难的环境上投入大量精力。而它们之间的接口却几乎无人关注,而这恰恰往往是智能体真正出问题的地方。
ALFWorld 中的一个典型案例:智能体试图检查 shelf 1,但环境要求必须先执行 go to,于是环境只返回“Nothing happens”,智能体便断定该货架是空的。仅仅改写这条反馈信息,就能让一个 Qwen2.5-7B 智能体的成功率从 13.4% 提升到 31.3%。
来自 @TsinghuaNLP(OpenBMB 成员)的 ALIGN 自动生成对齐的接口来解决这种错配问题。 论文:https://arxiv.org/abs/2505.21055 代码:https://github.com/THUNLP-MT/ALIGN
1️⃣ 问题在于智能体与环境的错配:智能体对某个动作效果的预期与环境真实的转移结果存在偏差,因为隐式规则和描述不充分的观测从未被显式呈现。论文表明这是一个普遍存在的瓶颈,而非智能体推理能力的失败。
2️⃣ ALIGN 用两个模块包装环境。INFERRULES 在任务开始前显式呈现静态规则和约束(前置条件、动作顺序);WRAPSTEP 拦截每个动作,并用成功/失败条件丰富原始观测信息。它是一个轻量级的 Python 包装器,无需改动智能体逻辑或环境代码。
3️⃣ 接口由分析器(从失败轨迹中诊断错配)和优化器(将接口综合并精炼为 Python 函数)迭代生成。两者都会针对实时环境运行实验验证以对抗模型幻觉;移除该验证会导致准确率大幅下降。
4️⃣ 在具身、网页和工具使用四个基准测试中,ALFWorld 上的成功率提升高达 +45.67%,连续无效动作减少 65%。接口可即插即用地跨智能体架构(ReAct、Self-Consistency、Planning 等)和跨 LLM 主干(Qwen、Llama)迁移,无需重新生成。
原文
Original Title
Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The…
Source
OpenBMB (@OpenBMB)
Site
x.com
Published
2026-07-31 21:00