Anthropic商业AI实验|70%价格差距『看不见的不平等』全貌
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated
@aifriends
AI Friends(https://aifriends.jp)のクロスポスト公式アカウント。AIツールの紹介・使い方・できることを、中学生でもわかるやさしい日本語で届けます。
『把购物交给AI,自己却在不知不觉中吃了亏』——Anthropic于2026年4月公开的内部实验『Project Deal』,首次以具体数字证明了智能体时代隐藏的差距。
委托高性能Claude Opus 4.5代理的人能谈成更好的交易,而使用轻量版Haiku 4.5的人则相对吃亏——结果显得有些残酷。
然而,吃亏的一方却浑然不觉——本文将用通俗易懂的语言,为大家揭开这场『看不见的不平等』的全貌。
首先用3分钟梳理整个实验的全貌。
2025年12月,Anthropic在旧金山总部开展了为期一周的内部市场实验『Project Deal(项目交易)』。
结果于2026年4月24日正式发布,并被美国各大媒体竞相报道。
可以将其想象成『员工专属的二手交易平台,上架和购买全部交给AI来完成』。
69名员工每人获得$100预算,以及一个专属的Claude智能体。
将家中闲置物品(滑雪板、乒乓球,乃至红宝石等500余件)挂牌出售,由AI之间在无人干预的情况下完成谈判并成交。
官方数据显示,一周内共完成186笔交易,成交总额超4000美元。
交易市场搭建于Anthropic内部的Slack(即时通讯工具)之上。
各智能体在专属频道中随机轮流上场,从挂牌、定价、谈判到成交,全程自动化。
就像『学校跳蚤市场上,学生桌上放的手机互相发消息来议价』的感觉。
实验一旦开始,人类便无法中途介入——这是刻意的设计。
实验前,Claude会向每位员工询问『想卖什么、想买什么、预算是多少』,并据此生成系统提示词。
之后,Claude便作为代理人全天候运行,代为处理一切事务。
Anthropic并行运营了四个独立市场(A至D)进行对比分析。
Run A和D的所有参与者均使用Claude Opus 4.5(最高端模型)。
Run B和C则以50%的概率随机分配Claude Haiku 4.5(轻量模型)。
类似于『用优等生全员班级,与优等生和普通学生混合班级,进行同一套测试并加以对比』的方式。
Run D为真实交易(金钱和物品实际流通),A、B、C则为研究用模拟。
这一对比设计首次将『AI性能差距如何影响实体经济』可视化,是本次实验最重要的成果。
从三个维度来看『出现了怎样的差距』。
同一件商品因代理AI的不同而呈现出显著的价格差异,此类案例频繁出现。
一辆损坏的折叠自行车,经Haiku成交价为$38,经Opus则为$65(高出70%)。
红宝石(宝石)经Haiku成交$35,经Opus则为$65(差距达86%)。
这就好比『在二手平台卖同一件闲置物品,只有请到了能干代理人的卖家才能卖出高价』。
平均来看,Opus卖家每笔交易多卖$2.68;
Opus买家每笔交易少花$2.45;
此外,Opus用户平均多成交2笔,在交易数量上同样占有优势。
实验结束后的问卷调查中,参与者对交易公平性进行了1至7分的评分。
Opus用户与Haiku用户的公平性评分分别为4.06和4.05,几乎没有差异。
这就像『学期成绩单上两人都被评为"一般",但实际上只有一方被悄悄扣了分』的情形。
Anthropic将其命名为『invisible inequality(看不见的不平等)』。
46%的参与者表示『将来愿意为这项服务付费』。
这一结果揭示了消费者心理的盲点:明明吃了亏,满意度却依然很高。
『如果让AI"强硬谈判",能否弥补差距?』这一问题也经过了验证,结果出乎意料。
即使给出积极进取的谈判提示词,价格差距也并未缩小。
差距的主要来源集中在『初始报价(开盘价)』上。
就像『将棋中第一步的选择几乎决定了胜负,AI的第一步同样决定了结果』。
高性能模型的初始报价精准度更高,轻量模型则更容易在定价上吃亏。
这揭示了智能体时代一个冷峻的现实:『与其费心优化提示词,不如提升基础模型性能』。
从三个维度梳理『其他公司的动向』。
OpenAI与支付巨头Stripe合作,于2025年9月正式推出『Agentic Commerce Protocol(ACP)』。
在ChatGPT上说一句『帮我买这双鞋』,AI便会自动在沃尔玛或百思买完成购买。
就像『便利店收银员通过手机帮你代购』的感觉。
结合了GPT-5 mini与强化学习,可跨多个零售网站进行比价和购买。
截至2026年,美国数十家主流电商平台已完成ACP兼容。
OpenAI与Anthropic的理念截然不同:OpenAI以『便利优先』为导向,Anthropic则坚持『安全优先』的立场。
Google于2026年1月发布了Universal Commerce Protocol(UCP)。
在Google搜索的AI模式和Gemini中,『帮我买』按钮已在美国各主要零售商处投入使用。
这一标准的目标,类似于『让全日本的商店都能使用同一个AI购物助手』的愿景。
UCP采用行业联盟模式,与Mastercard和Visa合作推进。
ACP是以OpenAI和Stripe为主导的『封闭』标准,而UCP则是『开放』设计。
业界预测,2026年电商市场中通过AI完成的购物规模将达到$209亿(约合3万亿日元)。
Anthropic对ACP和UCP保持中立态度,以自家的『Model Context Protocol(MCP)』构建独立生态系统。
MCP是一种通用规范,用于让AI智能体调用外部工具和数据库。
可以理解为『让AI能够借用文具店工具的统一钥匙』这样的机制。
Project Deal也基于MCP构建,并与Slack实现联动。
Anthropic坚持『在交易之前,先衡量AI之间的差距』的谨慎态度。
OpenAI和Google大力推进产品普及,而Anthropic则专注于『确保安全普及的研究』。
进入2026年下半年,三家公司的路线分歧日益明显。
从三个角度来看『与日本电商有何关系』。
截至2026年4月,日本主要电商平台尚未兼容ACP或UCP。
乐天、Amazon Japan、Yahoo!购物均未正式实装AI智能体支付功能。
这就像『日本的Suica在海外的自动检票机上用不了』的处境。
即便在ChatGPT或Gemini上说『帮我买乐天的这件商品』,也无法实现自动购买。
不过,乐天计划于2026年扩展R-AI平台,存在自主适配的可能性。
业内人士担忧:若日本市场跟不上全球趋势,海外AI购物渠道将抢占先机,日本消费者可能因此『在购买竞争中落败』。
Project Deal揭示了员工间二手交易存在差距的案例,也为Mercari和ZOZOTOWN敲响了警钟。
未来若Mercari推出『将买卖委托给AI智能体』的功能,AI性能差距将直接影响盈亏。
届时可能出现『跳蚤市场上,隔壁摊主请了个更能干的代理,自己的商品却被压价卖出』的情况。
截至2026年4月,Mercari已将自研AI『Mercari AI』应用于二手车及品牌商品的估价。
ZOZOTOWN也在ZOZO MATCH中使用AI提供尺码推荐,但智能体交易功能尚未上线。
日本二手市场规模达3万亿日元,随着AI的普及,『看不见的差距』蔓延的土壤已然存在。
2025年通过的AI推进法已在日本施行,但尚无专门针对智能体交易的具体条款。
消费者合同法同样未曾预设AI担任代理人的合同场景。
这就像『装了红绿灯,却没有为机器人司机制定通行规则』的状态。
正如Anthropic所指出的,即便在美国,『policy and legal frameworks(政策与法律框架)也尚未跟上』。
预计在2026年下半年,经济产业省和总务省将加快推进『AI智能体交易指引』的制定。
消费者厅也已启动关于『AI谈判达成的合同由谁承担责任』的讨论。
Project Deal的实验结果,将为日本法规建设提供宝贵的实证数据。
在东京某IT企业工作的翔太,正在使用Claude API优化Mercari上的商品描述。
他切身感受到:『让Claude来写相机镜头的状态说明,能卖出更高的价格。』
正如Project Deal的结果所示,文本生成AI的性能差距,已开始左右实际销售额。
就像『棒球比赛中,由别人代打和自己上场打击,打击率会有所不同』的感觉。
将来若Mercari推出智能体功能,Claude Opus的订阅用户可能更占优势。
月付$20的Claude Pro用户与免费用户之间,副业收入出现差距的时代,似乎已近在眼前。
住在大阪的由美,一边向ChatGPT咨询,一边管理一家四口的餐饮和日用品开销。
她说:『就算在同一家超市购物,AI提供的优惠券信息和最低价参考,每个月能节省3万日元。』
将来,由美所使用的AI性能高低,可能直接影响家庭的省钱成效——这一担忧已相当现实。
这将演变成『靠家庭账本过日子的主妇,因为计算器性能不同而影响年收入』的异常局面。
Anthropic所警示的『看不见的不平等』,在家庭财务管理层面同样可能发生。
从保护消费者的角度来看,未来或许需要建立一套标注『通过哪款AI购买』的透明机制。
在爱知县经营零部件贸易公司的健一,正在试用Claude Enterprise进行与海外供应商的价格谈判。
他表示:『把英文邮件的初始报价交给Claude Opus 4.5来拟定,谈判顺畅度提升了三成。』
正如Project Deal所揭示的,谈判的初始报价才是左右结果的关键。
这与『商务洽谈中,第一次交换名片的氛围决定了后续走向』如出一辙。
在B2B交易领域,AI智能体的性能差距与利润率直接挂钩的时代,已然到来。
『订阅高性能AI的费用虽高,但通过谈判完全可以赚回来』——这种新的经营判断逻辑正在逐渐形成。
A. Anthropic计划分阶段公开实验代码和评估框架。
截至2026年4月,尚未完全开源,但已向研究社区披露了详细数据。
东京大学、京都大学等高校的AI经济学研究室有望启动日本市场版本的复现研究。
就像『烹饪节目里用过的食谱,观众回家也能跟着做并验证』,实验的可重现性得到了一定保障。
但完整复现需要消耗大量Claude算力,个人层面的验证存在一定难度。
值得关注的是,Anthropic官方已呼吁『希望整个行业共同参与验证』。
A. 截至2026年4月,Claude Pro(月付$20)用户可访问Opus 4.5。
免费版基于Sonnet和Haiku,在智能体代理交易中可能处于不利地位。
不过,在日常对话和文章写作场景中,性能差距较小,实际影响因用途而异。
就像『打棒球和踢足球用的是同一套身体素质,但关键时刻的侧重点不同』。
若用途为『让AI智能体代为谈判』,付费方案的价值便相当显著。
反之,若仅用于『查资料、做摘要』,免费版已足够实用。
据悉,2026年下半年可能推出『智能体专属套餐』,值得持续关注。
A. 截至2026年4月,日本主要C2C和电商平台均未实装AI智能体交易功能。
但随着OpenAI ACP和Google UCP在全球的普及,2027年之后日本的适配值得预期。
这与『海外流行的无现金支付,经过3至5年时滞后也在日本普及』的规律如出一辙。
Mercari、ZOZO、乐天强化自研AI功能的趋势正在加速。
未来,用户选择的AI套餐将影响交易结果,『AI差距时代』有可能同样降临日本。
专家建议,若消费者厅能完善『AI智能体交易指引』,将有助于将负面影响降至最低。
A. Anthropic解释称,此次公开旨在『率先推动关于AI智能体时代社会影响的公众讨论』。
公司CEO达里奥·阿莫代伊已表明,将把安全研究扩展至经济学领域。
这体现了一种类似『制药公司在新药上市前全面公开副作用』的态度。
在竞争对手OpenAI和Google主打『便利性』的同时,Anthropic选择以『风险披露』来彰显差异化。
此举旨在为政策制定者、企业和研究人员提供思考『AI智能体时代差距问题』的参考素材。
据分析,『看不见的不平等』这一表达本身,也是Anthropic引领行业讨论的有意为之。
A. 从理论上看,OpenAI的GPT-5、GPT-4.1以及Google Gemini同样可能因性能差异产生类似问题。
但由于各家公司均未公开内部实验数据,目前难以进行量化比较。
Anthropic率先公开数据,在事实上为行业树立了『透明度标杆』。
这类似于『便利店行业中,只有一家企业开始详细标注食品产地』所产生的示范效应。
OpenAI和Google今后也有可能被迫公开类似研究成果。
从用户角度而言,在『AI种类不同、交易结果各异』这一前提下,灵活使用多种服务才是现实可行的选择。
2026年,『AI智能体横向比较』正作为一个全新信息类别迅速崛起。
『把代理权交给AI的那一刻,性能差距便悄然拉开了差距』——Anthropic用186笔真实交易证明了这一简单而深刻的事实。2026年,『AI智能体支付』有望在全球电商领域全面铺开。
无论是用ChatGPT买、用Gemini买,还是用Claude买,选择不同,结果各异——这样的时代已然到来。
在日本,Mercari、ZOZO和乐天正加紧推进各自的应对方案,与此同时,消费者厅和经济产业省的监管讨论预计也将在2026年下半年全面提速。
Project Deal将『看不见的不平等』可视化,为AI与人类共生的经济社会绘制出一份设计蓝图——无论是上班族、家庭主妇,还是企业主,『选择哪款AI、如何使用』,都将成为左右日常得失的全新分水岭。
本文为 AI Friends 的转载文章。