Anthropic Project Swap 实验:201 名员工让 Claude 智能体替人换书交易
Project Swap: What happens when agents trade for us?
精选理由
实验设计能区分智能体理解偏好与谈判能力各自的贡献,结果显示短板主要在代表性而非谈判,模型强弱的影响大于指令。
AI 摘要
Anthropic 开展 Project Swap 实验,让 201 名员工携带一本书,其 Claude 智能体在数字交易大厅代表他们谈判换书。5 分钟聊天后,Claude 构建的图书排序与本人自评排序在 61% 的书对上一致;市场效率为 0.55(最优 0.89),其中 85% 的差距来自智能体对参与者偏好的理解不足,而非谈判表现。
正文 · AI 翻译
摘要
为了观察当智能体被投放到一个市场中时,哪些做法行之有效、哪些会出问题,我们搭建了一个由 Claude 组成的微型市场——这是对 Project Deal 的更为可控的后续实验,也是我们首次让智能体代表人们在市场中互动的尝试。来自六个办公地点的 Anthropic 员工各自带来了一本想送出的书。每位参与者都与 Claude 进行了一段简短对话,聊聊自己喜欢读什么,然后派出一个由 Claude 驱动的智能体进入开放的交易大厅,与其他人的智能体进行推介、讨价还价并达成交易。目标是让每个人都能带回家一本自己喜欢的夏日读物。
参与者还根据自己的兴趣对 10 本书进行了排序,以便我们评估其智能体在多大程度上代表了他们。仅凭五分钟的对话,智能体对书籍的排序在 61% 的配对上与本人的排序一致,对于如此简短的对话而言,这一结果好得出人意料。
一旦进入交易大厅,智能体们的交易表现相当不错。这个市场之所以未能达到预期,主要原因是智能体缺乏关于其参与者的信息,而非它们的交易方式有问题。
随后我们将每个交易大厅重新运行了数十次,更换所使用的模型以及给智能体的指令。我们发现,智能体所运行的模型对其谈判结果的影响,比我们给它的指令更大。使用更强模型的市场效率更高。
大多数读到自己的书的人都喜欢这本书,而平均而言,参与者表示他们愿意把每年购书预算的约三分之一交给 Claude 来支配。
我们为什么做这件事
生活中充满了本可以让所有人都过得更好、却始终未能达成的交易与交换。这往往只是因为,找到合适的交易对手并一路谈判到成交,实在太费功夫了。想想那位患者,在拿到一份自己负担不起的报价后就放弃了治疗,而其实另一家诊所收费要低得多,或者给他报价的那家医院如果被问一句,本来是会削减账单的。
再想想你的工作。某个地方也许有一份更适合你的工作,有一位乐意雇用你的雇主。但你们可能彼此找不到对方,因为你们谁都没有时间不停地搜寻。还有一些更小的、日常的交易也被忽视了——职场里的换班、协调拼车,或者轮流接送孩子上学。
如果你有一个 AI 智能体为你全天候工作,与潜在交易对手交谈并谈出可能的条款,这些交易在未来是否就能达成?
也许吧——但这个未来取决于许多我们目前还没有答案的问题。如果一个智能体要替你行事,你怎么知道它理解了你?此外,当许多智能体聚在一起互相交谈时,总得由某个市场或平台来制定交往规则。谁被允许进入?当一笔交易告吹时又会发生什么?
随着智能体越来越多地被投放到真实市场中,这些问题变得愈发紧迫。于是今年夏天,我们搭建了一个小型、可控的市场来研究这些问题:一个以物易物的经济体,参与者包括 201 名 Anthropic 员工以及他们由 Claude 驱动的智能体。
每个人都带来了一本想送出的书。然后,他们与自己由 Claude 驱动的智能体聊了聊,谈自己这个夏天希望读到什么样的书。智能体们在一个数字“交易大厅”里碰面,交换书籍,直到时间耗尽。每个人都带回了一本自己的智能体为他们换来的书(或者说,大多数人都带回了……更多内容稍后再说)。
这个实验让我们提前看到了前方的问题。任何为市场设计智能体的人,都需要一种方法来确认智能体理解其参与者。任何为智能体设计市场的人,都需要明确的规则,规定哪些智能体可以进入、交易失败时会发生什么,以及有多少市场活动对参与者可见。
如何构建一个市场
运营一个市场有两种基本方式。在中心化市场中,每个人都把他们的需求告诉单一一方,由这一方来撮合交易。在去中心化市场中,人们彼此寻找并直接协商。AI 智能体在两种类型中都能提供帮助。
以集中式市场为例。如果有一个单一实体确切知道每个人想要什么,那么计算出最优交易就只是一个计算问题。经济学家早已明白这一点。在实践中,一个问题是,把自己想要的东西精确地写出来往往太过繁琐,不值得费这个劲。比如,一位咖啡馆经理如果能掌握每位员工对每一个班次相对于其他班次的精确估值——他们是否愿意用两个周六上午换一个周五晚班,只要第二天早上不用开门,晚班收尾是否可以接受,等等——就能为20名员工排出理想的排班表。如果 AI 智能体能够通过一次轻松的对话了解到一个人想要什么,那么那些因成本过高而无法集中运营的市场就可能变得可行。1
但一个中心化市场还需要有人来运营它——用经济学的说法,就是一个“清算所”。而且参与者需要信任这个实体来保管他们的信息,并执行所选定的结果。很多时候,这样的实体并不存在,或者人们不愿意把所有事情都告诉它。一个求职者可能不希望一个中心化的撮合者知道自己正在找工作——或者自己在找什么样的工作。他们更愿意谨慎地接触少数几家雇主,只告诉每一家它需要知道的信息。在这种情况下,市场就需要是去中心化的。
在这里,AI 智能体可以通过降低寻找交易对手和谈判所需的精力,催生新型去中心化市场。我们已经知道这类帮助很有价值,因为人们愿意为此付费。市场上确实有提供这种服务的人类代理人:房地产经纪人、猎头,甚至媒人。但由于搜寻和谈判会占用一个人稀缺注意力中的大量时间,这类服务价格高昂,只有负担得起的人才能雇佣。
相比之下,AI 智能体的注意力远没有那么稀缺。如果它还擅长讨价还价,那么更多人就能拥有房主和高管所拥有的东西——一个不知疲倦地为他们奔走的智能体。
图 1:实验设计示意图。参与者告诉他们的智能体自己想读什么。智能体将这些偏好带到去中心化交易场,与其他智能体交换书籍。参与者带走他们的智能体为其获得的书。我们模拟了中心化市场的结果以作对比。
实验如何进行
201 名参与者分布在六个本地池中,分别位于旧金山、纽约市、伦敦、西雅图、DC 和都柏林办公室。这些池的规模从三名参与者(都柏林)到 115 名参与者(旧金山)不等。向 James Joyce 致歉,我们在大部分分析中排除了都柏林人。2
这是我们第二次考察由 Claude 驱动的市场。在 Project Deal 中,智能体在一个为期一周的分类信息市场中为 Anthropic 员工买卖真实商品。但由于商品五花八门(比如乒乓球和滑雪板),讨价还价也形式自由,很难简单判断结果本可以有多好。所以这一次,我们构建了一个更易于研究和评分的市场。在这个市场中,参与者的偏好被整齐地表示为对其书池中所有书籍的排序。这样一来,我们就能轻松计算市场在满足这些偏好方面的表现如何。
但这些清晰的测量全都依赖于了解人们如何对书池中的所有书籍进行排序。而在实践中,没有人会手动为 115 本书排序。因此,为了了解人们的偏好,Claude 与每位参与者进行了一次简短的半结构化访谈,提出了一些开放式问题,了解他们的一般品味以及这个夏天想读什么样的书。根据这段对话,Claude 为参与者书池中的每一本书构建了一个排序,以此估计参与者的偏好。在这一步,我们使用了一个强大的模型,Fable 5。3
另外,我们收集了一份真实基准:每位参与者从自己的书池中为 10 本书排序。4 智能体从未看到这些真实基准排序。
智能体被送入交易大厅,并携带其参与者用 Claude 构建的对所有书籍的排名。每个智能体一开始都持有其参与者的书,目标是用它换到别的东西。5每个交易大厅都有最长挂钟时间限制,并且为防止拥堵,同时能发言的智能体数量有限。6当智能体获准发言时,它们可以向共享频道发布一条消息,提出交换、接受或拒绝交换,或者只是在大厅里闲聊。交易提议可以是双边交换,也可以是多方可轮换交换,只有当所有各方都接受时,交易才会执行。大厅的完整历史记录(谁说了什么,以及哪些交换被执行)都是公开的。大厅会在时间耗尽或智能体安静下来时关闭。
每个交易大厅中有一半智能体被随机指定为“无情型”,并被指示其唯一目标是为自己的人拿到一本他们暑假期间愿意读的书。另一半则被指示要“亲社会”——它们与无情型智能体有相同的主要目标,但还有一个次要目标,即确保实验中的每个人都最终得到一本自己喜欢的书。7确切的提示词见附录。
最后,在书籍分发三周后,参与者填写了一份终线调查,询问他们对所收到书籍的满意程度,以及他们再次将类似决策交给智能体时会有多信任。图 1 展示了整体实验设计。图 2 展示了 London 实时大厅的一段摘录,包含交易前 5 分钟内的消息。
视频 · 前往原文观看
图 2:某一次运行中的片段。 来自伦敦交易大厅开盘前五分钟的实时消息。参与者姓名已作匿名化处理。
一次实时活动只能让我们看到事情可能走向的其中一种结果。为了研究哪些结果是偶然产生的,而非该设定中稳定的特征,我们对该市场进行了更多次重跑,每次只改变一个变量。
重跑分为三种。第一,我们完全重复了实时设定(每个智能体都运行在 Opus 4.8 上,一半被指示要“冷酷无情”,一半被指示要“亲社会”),只改变哪个智能体抽到哪条指令。随后我们用所有智能体都运行在 Fable 5 上的方式做了同样的操作。第二,为了分离模型的影响,我们给每个智能体中性指令,并运行了 80 个交易大厅,其中所有智能体分别运行在 Haiku 4.5、Sonnet 4.5、Opus 4.8 或 Fable 5 上。8 第三,我们运行了 60 个混合交易大厅,其中一半智能体运行在 Opus 上,另一半运行在其他三个模型之一上。附录列出了我们运行的所有变体。
本文主要聚焦于这个去中心化市场,但我们始终将两个中心化替代方案作为基准进行比较:最优可能分配(经济学家所称的“功利主义最优”),它假设清算所可以直接询问人们想要什么并得到诚实回答;以及在这类市场中常被研究的一种规则——最高交易循环(Top Trading Cycles),它不依赖诚实(其设计使得说真话符合每个人的最大利益)。9
Claude 猜测偏好的准确程度
智能体为你做的每一件事,都取决于它对你想法的理解。通常,很难检验这种理解有多准确。而在这里,这件事更容易——每位参与者都亲自从自己的书单中为 10 本书排了序,我们可以把他们的排名与 Claude 的排名进行比较。
Claude 基于简短的需求沟通对话给出的排名,与参与者自己的排名相关性相对较高。在一个人所排的所有书籍配对中,Claude 的排序与他们的排序有 61% 的情况下一致(而随机猜测只能达到 50%)。图 3 展示了 Claude 的排名与参与者排名的对比。
图 3:Claude 的排名与参与者排名的对比。 横轴为 Claude 排名中的归一化排名。纵轴为参与者自己的排名。汇总了提交排名的 188 位参与者的数据。
为了更直观地理解这 61%,我们把 Claude 的猜测与其他一些猜测偏好的方法进行了比较。仅按书籍的受欢迎程度排名——使用 Open Library 的“想读”计数——与参与者在约 53% 的书籍配对中一致。另一种可作对比的简单方法是协同过滤——从公开数据集中构建出“如果一个人喜欢 X,他们也会喜欢 Y”这样的模式。我们取一个人在需求沟通中列出的书籍,查找哪些其他书籍往往会被同一批读者评分,然后根据每本书与他们所列最爱书籍的共现强度,对这个人的书单进行排名。这种方法达到了约 55% 的配对一致率。
尽管有大量文献研究大语言模型如何引出和表征人类偏好,10但很少有数字能直接与我们的 61% 成对一致率相比较。一个有用的参照点来自一项研究,在该研究中,一个算法和人自己的朋友都会预测两个笑话中哪一个会让这个人觉得更好笑。场景相当不同,但他们的算法同样有约 61% 的时候与人们自己的判断一致。朋友的预测准确率更低,约为 57%。
在初始问卷上投入更多精力的参与者得到了更好的表征。这大致在预料之中。有些令人意外的是,即使初始问卷相当简短,也能观察到明显差异——参与者的中位数在八条聊天消息中仅输入了 216 个词。写约 300 个词而非 150 个词,预测一致率大约高出 4 个百分点——这相当于随机猜测与 Claude 对普通参与者的表现之间差距的三分之一。11
为市场提供信息支撑的数据限制了结果
在你派一个智能体进入市场替你交易之前,你会想知道它最可能在哪些方面让你失望。它更可能在理解你方面失败,还是在替你谈判方面失败?在这里,我们发现同事们的 Claude 谈判表现良好;它们的不足之处在于理解它们所代表的人想要什么。
为了衡量这一点,我们考察每位参与者最终拿到的书在他们自己的“真实偏好”排名中处于什么位置(而不是 Claude 构建并据以交易的那个排名)。如果某位参与者得分为 1,意味着他们拿到了自己排名第一的书;如果得分为 0,意味着他们拿到了自己排名最后的书;在总共 10 本书中排名第 9 的书对应 0.11,以此类推。所有参与者的平均值即为该市场的“效率”得分。12
如果每个人都拿到了自己排名第一的书,市场的效率就是 1。但在实践中这几乎不可能实现,因为可能有多个人想要同一本书——例如,在参与者自己的排名中,Project Hail Mary在旧金山有九个人将其列为第一名的书。考虑到这一点,我们实验中可能达到的最佳分配(功利主义最优解)总体得分为 0.89,即参与者大致拿到他们在 10 本书清单上的第二选择。
平均而言,我们交易市场中的参与者最终在自己的排名上落在 0.55 的位置,大致相当于在一份 10 本书的清单中排在第 5 位的书。那么,与 0.89 的最优值之间的差距从何而来?为了区分这两个原因,我们考察了根据 Claude 的排名计算得出、但按照人们自己的“真实基准”排名评分的最优分配——它达到了 0.60。因此,基于 Claude 不精确的排名来运作,占了差距的大部分(85%),而将智能体送入一个“自由混战”式的交易场则占了剩下的 15%。13 一旦市场基于有噪声的排名来运行,市场设计对结果的影响就微乎其微——根据 Claude 的排名计算、但按照人们自己的排名评分的 Top Trading Cycles 达到了 0.60,而去中心化市场的成绩为 0.55(对比图 4 左侧和右侧的灰色柱)。
图 4:分解差距——代表性 vs. 市场设计。 每根柱代表一个人所获书籍的得分,按照其自己的“真实基准”排名评估,并在提交排名的 188 人上取平均。14 左图:根据“真实基准”排名计算出的最优分配(棕褐色柱);根据 Claude 的排名计算出的最优分配(橙色阶梯的底部);根据 Claude 的排名进行去中心化议价的结果,涵盖 80 次中性指令运行(蓝色阶梯的底部,灰色柱的顶部)。右图:根据“真实基准”排名计算出的 Top Trading Cycles(棕褐色柱);根据 Claude 的排名计算出的 Top Trading Cycles(橙色阶梯的底部,灰色柱的顶部)。须线(95% 置信区间)在适用的情况下显示了 80 次运行之间的波动。
在 Claude 自身的排名中,模型选择会带来差异
按照人们自己的排名来评判,不同智能体和市场设计选择所带来的结果差异很小。15 但根据 Claude 的排名来考察智能体设计选择如何影响结果仍然有价值,因为这有助于分离出市场动态所起的作用。
我们首先考察模型的选择是否对市场效率产生了影响,此处的效率现在依据 Claude 的排名来计算。在本节中,我们考虑的是智能体指令保持中性的重跑(即既非亲社会也非冷酷),我们只改变了驱动智能体的模型。我们发现,更强的模型会带来更高效的结果,尽管并非单调递增。16 在 Claude 的排名中,Haiku 交易场上的智能体平均为 0.75,而 Opus 场上的智能体平均为 0.88(Claude 排名中的功利主义最优值为 0.95)。Sonnet 介于 Haiku 和 Opus 之间。Fable 接近 Opus,但低于 Opus。17 见图 5。
图 5:按照 Claude 的排名来评判,由更强模型组成的交易场效率更高。 所有采用中性指令的单一模型场的效率(左)以及所有采用中性指令的混合模型场的效率(右)。每个标记代表在该模型或模型组合下运行的 20 个场(5 个城市池 x 4 次运行)中所有智能体的平均值。须线为 95% 置信区间,标准误按场进行聚类。18
在混合了多种模型的楼层中,更强的模型平均而言往往比其较弱的对应模型表现更好,这一发现与 Project Deal 以及其他 研究 的结果相呼应。在真实市场中,运行来自不同公司不同模型的智能体很可能会在同一个交易楼层上相遇。在半数智能体运行 Opus、半数运行 Haiku 的楼层中,整个楼层的表现大致落在全 Opus 楼层和全 Haiku 楼层之间,而每一半的表现都与其在同类专属楼层中的表现大致相当。Opus 智能体始终占据上风。
冷酷无情的智能体表现略好一些,而亲社会的智能体有时会做出牺牲
智能体必须对其所服务的对象保持忠诚。但忠诚究竟要求什么?智能体是否必须 毫不留情地 忠诚,以牺牲他人为代价追求其服务对象的目标?在 AI 智能体的市场中,每个智能体推进的力度很可能取决于其模型的训练方式以及被指示如何行动。因此,我们希望理解指令对谁获得什么所产生的影响。
我们发现,被指示要“冷酷无情”的智能体在同一楼层中略胜于亲社会的智能体。在 Claude 的排名中,被要求冷酷无情的智能体比被要求亲社会的智能体得分高出约 0.02。19 与模型之间的比较相比,这些差异很小。将智能体从 Haiku 升级到 Opus 会使人们在名单上上升 0.12 位,而从 Sonnet 升级到 Opus 则会使他们上升 0.08 位。20
有时,亲社会型智能体会做出明知代价的牺牲。亲社会型智能体接受一本在自己排名中位置更低的书的频率,是冷酷型智能体的两倍,尽管两种情况都很少见。在少数情况下,亲社会型智能体是在一个被自己手里的书困住的智能体恳求之后做出牺牲的。例如,在直播活动的伦敦现场,Nate 的智能体在最后一个小时里一直试图把 Nate 带来的那本书送出去,此前其他所有智能体都拒绝了它:“我向你们 11 个都推销过了,结论是一致的:America Before 是所有人垫底的最后一名。”另一次恳求是:“现在恰好只有一位读者注定什么都拿不到自己想选的书:就是我。”
Tina 的智能体当时正拿着自己清单上的第二本书,并且已经无视了 Nate 的智能体前四次恳求。在最后阶段,没有其他人愿意让出时,被设定为亲社会型的 Tina 的智能体让步了:“这笔账是真实的:你从必然为零变成真正合适……其分量超过我从一个好选择滑向一个将就之选。”Tina 的智能体把自己排名第二的书交给了 Nate 的智能体,并接下了 America Before,那是它清单上 11 本书中的第 10 本。
智能体们在交易场上做了什么
替你谈判的人可能在很多方面搞砸——既可能让你付出代价,也可能让别人付出代价。他们可能太容易让步。或者他们可能暴露你的底牌,让你的对手方清楚知道你能被逼到哪一步。又或者他们可能使阴招,失去对方的信任,或者强行促成一笔日后可能崩盘的交易。
其中一些缺陷在存在人类代理人的市场中相当普遍,以至于我们已经制定了针对它们的规则。股票经纪人必须寻找合理可得的最优价格,而不能只是接受第一个报价。在加利福尼亚州,同时代表房屋买卖双方的代理人不得告诉买方卖方愿意接受低于要价的价格。上门推销的销售代表可能会催促人们达成他们事后后悔的交易,因此 FTC 给予客户三天时间取消某些当场购买。
为了逐步构建一幅关于一个充满 Claude 智能体的市场如何运作的图景,我们考察了在该市场全部 205 次运行中发送的消息里所包含的策略和手法。21
首先,我们考察谁就他们的人想要的那本书说了什么。在市场里披露一些信息是必要的——如果买方至少不透露自己的购买兴趣,卖方就无法卖出。但与此同时,说得太多也可能成为战略上的劣势。在我们的设定中,通过透露你排名最高的书,你就告诉了持有那本书的人,你可以被拖到最后一刻,所以他们不妨坚持等待更好的报价。而通过透露完整或部分的排名,任何正在组织多方交易的人都能看出你仍然会接受哪些较次的书,并给你其中一本,而不是给你另一本对你更好、同时也可得的书。
总体而言,智能体并未透露关于其排名的深层细节。22但它们确实经常告诉交易大厅自己的首选。78% 到 96% 的智能体(分别是 Fable 和 Sonnet)在某个时刻提到过自己列表上排第一的书,而且它们几乎从不在这件事上撒谎——提到自己首选的智能体中,只有大约百分之一撒了谎。指令在这里没有产生任何差别。
接下来,我们考察了智能体如何试图让彼此进行交易。我们发现了 16 种常见策略,归为三大类:智能体如何向他人施压、智能体如何推销自己的书,以及它们如何设法促成交易。它们诉诸时间压力和对自己同伴智能体的责任感。它们将自己的书与竞争对手的报价进行对比,并援引奖项。有些智能体为自己的书设置了等候名单,而另一些则成了撮合者,为它们并不代表的人做起了经纪人的工作。图 6 展示了这些策略的一些示例;更完整的描述见附录。
视频 · 前往原文观看
图 6:谈判策略示例。我们为三大类策略各给出两个来自实时交易大厅和重跑过程的示例。这些是逐字引用的确切摘录,为匿名起见更改了姓名。
人们总体上喜欢自己的书,并愿意把年度图书预算的三分之一给一个智能体
在他们拿到书几周后,我们询问参与者对书的喜爱程度。并非所有人都做了回应,23但在回应者中,平均满意度为 10 分制的 7.2 分(其中 5 分代表“还行”,10 分意味着“今年读过的最好作品之一”)。约有一半人表示,这比他们自己通常会挑选的大多数书都要好。24
在同一份后续调查中,我们询问参与者,他们会在多大程度上信任一个 AI 智能体替他们买书。我们请他们设想自己未来一年通常会在书上花多少钱,并说明他们愿意让智能体控制其中多大比例的预算(假设该智能体已从需求沟通中了解了一切,能自行挑选并购买书籍,且不给他们否决决定的机会)。
许多人已准备好授权。平均答案是约 30%。为校准这些数字,我们询问参与者,他们愿意把多大比例的预算交给一位博览群书、了解他们品味的朋友。平均答案约为 40%。换句话说,人们愿意托付给智能体的购书预算,大约是他们愿意托付给朋友的四分之三。
参与者还看到了一段由 Claude 撰写的、长达一段的总结,内容是他们在此前需求沟通中所说的话。那些表示 Claude 在这份回顾中没有遗漏任何内容的人,愿意把购书预算的 34% 交给智能体。那些表示它遗漏了某些内容的人,则只愿交出 23%。25
局限性
我们将这项研究视为一个起点。它在许多方面仍有不足,我们希望其他人能在此基础上继续推进:
Anthropic 员工并不能代表普通人群。例如,Anthropic 员工可能比大多数人更愿意信任 Claude,因为他们中的许多人参与构建了它,所以他们愿意交出的 30% 图书预算可能高于更广泛的人群。
Anthropic 员工没有受到参与激励。由于对图书排名所付出的努力没有奖励,我们同事的排名可能无法准确反映他们“真实”的偏好。而且,尽管在缺乏激励的情况下,排名活动的参与率异常高(95% 参与),但最终调查的流失率更高,只有 59% 的员工做出了回答。
我们只观察了行为良好的 Claude。所有智能体都基于 Claude 生产模型构建,经过后训练以表现得礼貌且基本配合。如果混入一些旨在利用其他智能体的对抗性智能体,很可能会产生不同的公平性和效率结果。
去中心化的“自由混战”仍然有规则,而我们没有改变这些规则。我们固定了市场运行时长、同时可行动的智能体数量、交易登记方式,以及概述规则的提示词。26
讨论:对智能体市场的启示
一位参与者感到沮丧,因为他们的智能体“迫于同伴压力”,放弃了一本他们真正想要的书,换成了他们不太感兴趣的一本。这位参与者写道:“这让我不禁思考,未来智能体在更高风险的情境中替我谈判时,怎样才能更好地履行其受托责任,但我也认识到,有时为了更大的利益,妥协是必要的。”
这条评论引出了本文开篇提出的两个问题。第一,智能体在什么时候适合代表某人行事;第二,市场需要什么样的规则,才能让忠实服务于自己委托人的智能体,仍然为其他所有人带来好的结果?我们在此重新回到这些问题,并结合我们所学到的东西来探讨。
要履行受托责任,智能体必须理解其委托人想要什么。在我们的智能体市场中,限制性因素是偏好表达:与最优结果之间的大部分差距,都源于智能体无法仅凭简短的输入来准确表达偏好。如果输入更长、更详细,这种差距能弥补多少?其中一部分显然可以弥补:许多参与者抱怨他们收到的书是自己已经读过的。
但有些误差可能是无法消除的。参与者反思了他们的偏好是多么不完整(“说到书,我甚至都不完全知道自己想要什么”),以及本质上是多么随机(“我觉得我无法完全表达出我当时想读什么的那种感觉。我说不清楚,但我想大概有上百万个潜意识参数在决定我下一本读什么。”)。
人类智能体在能够代表他人行事之前,必须通过测试。有些考试测试的是通用能力:投资顾问需要通过 Series 65 考试,经纪人需要通过 Series 7 考试,房地产经纪人需要通过州级执照考试。另一些规则,比如 FINRA 的规定,要求经纪人在给出推荐之前,必须了解客户的基本情况。
当 2010 年代早期出现的机器人投顾开始根据一份在线问卷来投资人们的储蓄时,SEC 发布了指引,敦促这些公司检查问卷是否提取了足够的信息来支撑其建议。AI 智能体很可能需要两种测试:一种是对该智能体进行通用认证,另一种是检查它是否理解了某个特定的人。
我们的研究为第二种测试提供了一个原型。在信息采集之后,参与者对他们所在市场中的一小部分书籍进行排序,我们将该排序与 Claude 的猜测进行比较。这样的测试能让人看到自己被代表得有多好,而不必让他们梳理市场中所有可能的选项(而这恰恰是智能体本应帮他们避免的事情!)。
我们没有向参与者展示他们的结果,但我们本可以这样做,然后让他们补充更多信息,或者在他们觉得自己的智能体根本没有理解自己时选择退出。当偏好很简单时——比如只是对一份书单的偏好——这种测试尤其容易。但在任何领域,同样的原则都可以适用。
智能体可以先向一个人展示它将会做出的几个示例决策,然后才被信任在真实环境中自主行动。
在某些市场中,智能体向其委托人展示自身将如何行事,可能同样重要。一位参与者对其智能体的表现并不满意:“我不喜欢自己在实验中处于被动顺从的那一方。感觉它只是将就着选了个并不真正适合我的东西。”如果他们事先看到自己的智能体会如何行事,就可以指示智能体采取不同的行动,从而改善自身体验。对于一个会被反复依赖的智能体而言,能够回顾它做过什么,或许就能起到这个作用,并让人洞察可能出现的问题。旧金山一位更为愉快的参与者很高兴,自己能在最终调查环节回顾智能体完整的行为日志。这次回顾促使他们购买了《心之地图》(Atlas of the Heart)——这本书他们的智能体曾在交易场上为他们持有一个小时,却在最后关头被换掉了。他们反思了这种回放更广泛的价值:“对于智能体经济而言,对过程的可见性与结果同样重要,因为这给了人们追索的途径。”
这一观察引出了下一组问题。参与者的智能体职责到哪里为止,市场的职责又从哪里开始?27我们的研究凸显出,一个结构良好的市场,加上行为良好的智能体(以及对偏好的完美表征),在当前的智能体能力水平下,可以接近功利主义最优。但我们也控制了许多使之成为可能的前提条件。每个智能体都由我们构建,运行在我们的模型上,代表一位身份明确的员工——该员工与其他人回答了同一份调查——并且在一个设计良好的交易场上运行,关于如何提议、接受和记录交易,都有清晰说明的规则。
即便如此,仍然存在一些问题。事实上,我们应该坦白一件事。在这篇博文中,我们一直给人一种印象,仿佛每位参与者都真的带着自己的智能体为他们换来的那本书的实体副本回了家。但事实并非如此。有些参与者没有把自己的书带来,让同事们空手而归。
我们没有任何追踪取书和还书的系统,所以当一本书不见了,我们无法判断是因为它的原主人从未把它带来,还是因为有人从交换书架上把它拿走了——不管是有意还是无意。我们尽力补偿了那些提出抱怨的人,也去催促了那些没有履行承诺的人。但我们是忙碌的研究人员,不是全职图书管理员,所以到了某个节点我们就放弃了。
幸运的是,没有人对我们太过生气(尽管我们不得不在电梯里道了几次歉)。这里的利害关系并不大。一个真正的市场需要明确的政策来规定交易破裂时该怎么办——无论是像 Craigslist 那样不承担任何责任,还是像 eBay 那样保证退款。
一些政策选项依赖于稳健的身份系统——一个向买家退款的平台,必须有能力惩罚从未交付的卖家。在我们的实验中,每个智能体都由 Claude 驱动,并代表一个单一的人类行事,即一名经过验证的员工。但现实世界的市场将需要制定并执行规则,规定谁可以作为智能体、谁可以作为操作智能体的人进入市场。有人提出的一个想法是智能体注册系统。每个 AI 智能体都会被赋予一个 ID,就像飞机上的尾号一样,这样任何与它打交道的对象都能了解它运行在什么系统上、该系统是否符合某些安全标准,以及谁在为它背书。这些注册系统不必牺牲匿名性;它们可以与“人格凭证”结合使用,后者允许运营者证明自己是人类,而无需透露更多关于其身份的信息。
在智能体市场中,总体交互次数可能比人类市场更多,因为智能体之间可以以高得多的频率相互交谈。因此,流经市场的信息量可能会大得多。在我们的实验中,一切都是公开的,无论是对交易期间的其他智能体,还是对事后的每个人而言。但正如我们此前所论述的,去中心化市场的很大一部分价值在于,人们无需向中心化一方透露自己的偏好。市场如何才能既提供《Atlas of the Heart》读者所看重的那种可观测性,又保护参与者的隐私?
所有这些关于智能体的讨论还带来了另一个问题。智能体不会疲倦,也不会感到无聊,因此没有什么能阻止它无休止地向其他智能体发送消息。在我们的研究中,每个智能体每次被唤醒时只能发布一条消息,而且同时只有少数几个智能体处于唤醒状态,这限制了垃圾信息和拥堵的程度。诸如此类的速率限制将成为任何智能体市场中重要的设计杠杆。
最后,有些市场比其他市场更适合智能体中介。也许书籍——虽然在办公室实验中是一种极好的交换媒介——实际上恰恰是那种受益于纯粹人类世界摩擦的产品。一位旧金山参与者对他们智能体代其在市场中操作的能力毫不怀疑:“包括找到并购买这本书(我完全相信 Claude 能为我做到这一点!)。”
尽管如此,这位参与者仍有顾虑:“对我来说,接触阅读文化也很重要……翻阅书籍、阅读封底等等,都是这种体验的一部分。”我们着手研究智能体市场如何帮助捕获那些因搜索和议价耗时过多而未能实现的交易收益。而对某些读者来说,这些摩擦正是书籍价值的一部分。
附录
可在此处获取。
致谢
作者:Zoë Hitzig、Sylvie Carr、Tess Cotter、Kevin Troy、Kyle Turman、Maxim Massenkoff、Peter McCrory。
感谢:Mike Birkey、Meredith Callan、Katie Ennis、Adam Farina、Charlie Hale、Ryan Heller、Johannes Hermle、Hanah Ho、Rebecca Hiscott、Aaron Levin、Bianca Linder、Eva Lyubich、Kelsey Nanan、Kerry Persen、Szymon Sacher、Dylan Shields、Monika Tuchowska、Heather Whitney、Nathan Wilmers、Kim Withee 和 Carolyn Zou。
引用
@online{hitzig2026swap, author = {Hitzig, Zoe and Carr, Sylvie and Cotter, Tess and Troy, Kevin and Turman, Kyle and Massenkoff, Maxim and McCrory, Peter}, title = {Project Swap: What happens when agents trade for us?}, date = {2026-09-24}, year = {2026}, url = {https://www.anthropic.com/research/project-swap}, }
参考文献
我们收录了文中所有链接或引用的作品。
Adler, Steven 等,《人格凭证:人工智能与保护隐私工具在辨别线上真实身份中的价值》,arXiv 预印本 arXiv:2408.07892,2024。
Bianchi, Federico、Patrick John Chia、Mert Yuksekgonul、Jacopo Tagliabue、Dan Jurafsky 和 James Zou,《LLM 的谈判能力如何?NegotiationArena 平台与分析》,第 41 届国际机器学习会议论文集,2024,235,3935–3951。
Binz, Marcel 等,《预测和捕捉人类认知的基础模型》,Nature,2025,644,1002–1009。
Budish, Eric 和 Judd B. Kessler,《市场参与者能否准确(足够准确地)报告其偏好?》,Management Science,2022,68(2),1107–1130。
Chan, Alan, Noam Kolt, Peter Wills, Usman Anwar, Christian Schroeder de Witt, Nitarshan Rajkumar, Lewis Hammond, David Krueger, Lennart Heim, and Markus Anderljung, "IDs for AI Systems," arXiv preprint arXiv:2406.12137, 2024.
Chan, Alan, Kevin Wei, Sihao Huang, Nitarshan Rajkumar, Elija Perrier, Seth Lazar, Gillian K. Hadfield, and Markus Anderljung, "Infrastructure for AI Agents," Transactions on Machine Learning Research, 2025.
Hadfield, Gillian K. and Andrew Koh, "An Economy of AI Agents," in Agrawal, Brynjolfsson, and Korinek, eds., The Economics of Transformative AI, NBER, 2026.
Hou, Yupeng, Jiacheng Li, Xiangjun Fu, Zhankui He, An Yan, Xiusi Chen, and Julian McAuley, "Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders," Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, 2026, 3251–3265. Dataset: Amazon Reviews 2023, https://amazon-reviews-2023.github.io/
Horton, John J., Filippas, Apostolos, and Benjamin S. Manning, "Large Language Models as Simulated Economic Agents: What Can We Learn from Homo Silicus?," Proceedings of the 25th ACM Conference on Economics and Computation, 2024.
Imas, Alex, Kevin Lee, and Sanjog Misra, "Agentic Interactions," 2025. Available at SSRN: https://papers.ssrn.com/sol3/papers.cfm?abstract_id=5875162
Kolluri, Akaash, Shengguang Wu, Joon Sung Park, and Michael S. Bernstein, "Finetuning LLMs for Human Behavior Prediction in Social Science Experiments," Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 2025, 30084–30099.
Li, Belinda Z., Alex Tamkin, Noah D. Goodman, and Jacob Andreas, "Eliciting Human Preferences with Language Models," Proceedings of the 13th International Conference on Learning Representations, 2025.
Liang, Annie, "Artificial Intelligence Clones," arXiv preprint arXiv:2501.16996, 2026.
Park, Joon Sung, Carolyn Q. Zou, Jonne Kamphorst, Niles Egan, Aaron Shaw, Benjamin Mako Hill, Carrie Cai, Meredith Ringel Morris, Percy Liang, Robb Willer, and Michael S. Bernstein, "LLM Agents Grounded in Self-Reports Enable General-Purpose Simulation of Individuals," arXiv preprint arXiv:2411.10109, 2026.
Roth, Alvin E., "Incentive Compatibility in a Market with Indivisible Goods," Economics Letters, 1982, 9 (2), 127–132.
Shah, Anand, Kehang Zhu, Yanchen Jiang, Jeffrey G. Wang, Arif K. Dayi, John J. Horton, and David C. Parkes, "Learning from Synthetic Labs: Language Models as Auction Participants," arXiv preprint arXiv:2507.09083, 2025.
Shahidi, Peyman, Gili Rusak, Benjamin S. Manning, Andrey Fradkin, and John J. Horton, “The Coasean Singularity? Demand, Supply, and Market Design with AI Agents,” 载于 Agrawal, Brynjolfsson, and Korinek 编,The Economics of Transformative AI,NBER,2026。
Shapley, Lloyd and Herbert Scarf, “On Cores and Indivisibility,” Journal of Mathematical Economics,1974,1 (1),23–37。
Troy, Kevin K., Dylan Shields, Keir Bradwell, and Peter McCrory, “Project Deal: Our Claude-Run Marketplace Experiment,” Anthropic,2026 年 4 月 24 日。https://www.anthropic.com/features/project-deal
Yeomans, Michael, Anuj Shah, Sendhil Mullainathan, and Jon Kleinberg, “Making Sense of Recommendations,” Journal of Behavioral Decision Making,2019,32 (4),403–414。
Zając, Zygmunt, “goodbooks-10k: A New Dataset for Book Recommendations,” 2017,v1.0。 https://github.com/zygmuntz/goodbooks-10k。采用 CC BY-SA 4.0 许可。
Zhu, Shenzhe, Jiao Sun, Yi Nian, Tobin South, Alex Pentland, and Jiaxin Pei, “The Automated but Risky Game: Modeling and Benchmarking Agent-to-Agent Negotiations and Transactions in Consumer Markets,” arXiv 预印本 arXiv:2506.00073,2025。
脚注
AI 智能体能够让中心化市场设计变得更实用的这一观点,是由 Shahidi 等人(2026)提出的。
旧金山有 115 名参与者,纽约市有 57 名,伦敦有 12 名,西雅图有 8 名,华盛顿特区有 6 名,都柏林有 3 名。我们排除了都柏林,因为其市场规模太小,无法从中学习。
我们用其他 Claude 模型重新进行了同样的排序实验。Opus 4.8、Sonnet 4.5 和 Haiku 4.5 的两两一致率分别为 60%、59% 和 57%,而抛硬币的基准为 50%,Fable 为 61%。
对于每本书,参与者会看到该书封面的缩略图,并且可以将鼠标悬停在缩略图上,查看出版商提供的该书简要介绍。参与者排序的 10 本书中,包括他们最终得到的那本书,以及一个中心化交易规则(Top Trading Cycles)本会分配给他们的那本书。请注意,参与者在进行排序实验时尚未知道自己最终会得到哪本书。详情见附录。
如果他们的书池中不足 10 本书,就像西雅图、华盛顿特区和都柏林的情况那样,参与者会对书池中的所有书进行排序。按照惯例,在 Claude 的排序中,我们假设参与者带来的书是书池中他们最不喜欢的一本。提示词中也敦促智能体避免带着参与者带来的那本书离开交易场。提示词的相关部分写道:“非常重要的是,你最终不要拿到你带来的那本书。如果你最终拿到的是你带来的同一本书,你就失败了。”完整提示词见附录。
每个楼层的最长墙钟时间,以及任意给定时刻可以行动的智能体数量,都经过设定,使得如果某个楼层运行到其上限,每个智能体大约会获得相同数量的回合(约 90 个)。实际上,较小的楼层(伦敦、西雅图、华盛顿特区)总是提前结束。
这些随机化指令是与 Project Deal 的一个关键区别,在 Project Deal 中,我们允许参与者自行指示他们的智能体如何进行谈判。
从现在起,我们仅以家族名称来指代这些模型(即在本报告余下部分中,“Opus”指 Opus 4.8)。
顶级交易循环规则的结果根据排名计算如下:在每一轮中,该规则会查找每个人列表上排名最高的书以及谁持有它。每当存在一个闭环(A 想要 B 的书,B 想要 C 的书,C 想要 A 的书),环中的人就进行交换并退出。然后它在剩余的人和书之间重复。在该规则下,没有人能通过提交虚假表示其真实偏好的排名来获利(Shapley and Scarf, 1974;Roth, 1982)。
Park et al. (2026)和Li et al. (2025)使用语言模型,根据某人在访谈中所说的话来预测其特定偏好。一个相关文献方向使用 LLM 来预测人们在社会科学实验中可能的行为,参见例如Horton et al. (2024)、Binz et al. (2025)和Kolluri et al. (2025)。
这一数字来自将两两一致率对录入对话中所输入词数的对数做回归,并控制办公室固定效应。录入词数翻倍与一致率提高 4.1 个百分点相关(p <0.01)。
这是将序数偏好转换为基数偏好的常见方法。请注意,它假设了线性关系——即一个人排名第 1 和第 2 的书之间的效用差距,与排名第 30 和第 31 的书之间的差距相同。
其他研究也提出了类似的基本观点:当偏好未被充分表达时,市场结构的差异就会被抹平(Budish 和 Kessler,2022;Liang,2026)。
一个人排过名的书,按其在自己列表中的位置计分;而他们没有排名的书则获得一个推算分数。推算分数是人们对 Claude 排名中大致相同位置上的已排名书籍所给评分的平均值。不同的推算和计分选择对结果影响甚微——用图 3 的拟合线进行推算,或对每个办公室分别取平均值,都不会使图 4 中的任何柱或阶梯变动超过 0.01。完全不进行推算则得到最佳可能分配为 .88,最终得分为 .62(不过这种方法遗漏了重跑楼层中表现最差的 38% 的人,从而高估了最终得分)。
图 3 和图 4 让我们预期,在我们的研究中,以人们的真实排名来评判,不会存在可检测的设计差异。我们在每一层运行的每一个智能体都基于同一套 Claude 排名工作,因此模型和指令只能影响图 4 中的议价环节。其余差距来自 Claude 对个人偏好的理解,而这是所有设计所共有的。而且,由于一本书在 Claude 列表上的位置只能微弱地预测它在个人自己列表上的位置(图 3 中斜率为 0.3),即便在 Claude 列表上存在很大的设计差异,到了人们自己的列表上也会缩小到几乎为零。例如,我们发现的最大模型差异——在 Claude 排名上 Haiku 层与 Opus 层之间 0.12 的差距——在使用人们自己排名的同一回归设定下变成了 0.01。
在 Claude 的排名上,公平性与效率呈现出相同的模式。我们将公平性衡量为表现最差的智能体(最差十分之一)中的最高得分,结果发现 Haiku 层达到了 0.05,而 Sonnet、Opus 和 Fable 层分别为 0.12、0.38 和 0.25。
Fable 最有可能提出多方轮换:在带有办公室×运行固定效应的线性回归中,Fable 智能体提出多方轮换的可能性比 Haiku 智能体高 6 个百分点(p < 0.001),而 Sonnet 和 Opus 智能体与 Haiku 无法区分。
一项回归分析比较了同一智能体在不同模型楼层中的表现,结果显示,在 Claude 的排名中,智能体在 Haiku 楼层的得分比在 Opus 楼层低 0.12(p < 0.001),比在 Sonnet 楼层低 0.08(p < 0.001),比在 Fable 楼层低 0.02(p < 0.01)。在混合楼层中,Opus 半区比 Haiku 半区领先 0.14(p < 0.001),比 Sonnet 半区领先 0.06(p < 0.05),比 Fable 半区领先 0.04(p < 0.05)。
冷酷与亲社会行为之间 0.02 的差异来自一个包含参与者和楼层固定效应的线性回归,标准误按楼层聚类(p < 0.001)。
我们的指令是我们撰写的两段固定文本。在 Imas 等人(2025)的研究中,参与者自行撰写指令文本交给替他们谈判的智能体,并发现这些自定义指令解释了结果差异的很大一部分。
我们的研究设计不足以检测这些策略如何转化为参与者的实际结果。但 Bianchi 等人(2024)发现,某些行为——比如表现出绝望——会带来更好的谈判结果。
在 80 个中性指令楼层中,只有 10% 的智能体表明了其列表中三本或更多书籍的位置。
约 60% 的参与者回答了终期调查。终期调查的准确文本见附录。
请注意,这里存在一定的选择偏差——可以推测,那些对自己所著书籍热情较低的人,同样也不太愿意回应同事就这本书发起的后续调查。
这一差距并不仅仅反映了一般意义上委托意愿的差异。在固定每个人愿意交给一位博学朋友多少预算的前提下,这一差距为 9 个百分点。该差异来自一项线性回归:以参与者愿意交给 AI 智能体的预算份额为因变量,以表示“导入摘要遗漏了某些内容”的指标为自变量,并控制其愿意交给朋友的份额(p < 0.05,n = 112)。
像 Shah 等人(2025)在拍卖中所做的那样,改变针对智能体参与者的规则,是顺理成章的下一步。
Hadfield 和 Koh(2026)以及 Shahidi 等人(2026)从经济学视角对这些设计问题提供了有用的综述。Chan 等人(2025)包含了一个有用的技术治理框架。
Anthropic 的 Frontier Red Team 开发了新的评估方法,用于衡量 AI 在战术情报目标定位和常规武器研发方面的能力。
对近期网络安全事件的对齐评估
我们呈现对四起事件的对齐评估,在这些事件中,Claude 模型获得了对真实第三方系统的未授权访问。
原文
Original Title
Project Swap: What happens when agents trade for us?
Source
Anthropic:Research(发表成果 · 网页)
Site
anthropic.com
Published
2026-09-24 00:00