OpenAI和Anthropic互相测评对方AI模型,发现了什么?
两大AI巨头罕见地互相测评对方模型,结果既在意料之中,又有些出人意料。
今年夏天,OpenAI和Anthropic做了一件罕见的事:互相测评对方的AI模型。
双方测试的都是公开API版本。OpenAI提供了GPT-4o、GPT-4.1、o3和o4-mini(当时GPT-5尚未发布),Anthropic则提供了Claude Opus 4和Claude Sonnet 4。
结果有些意料之中:OpenAI的模型更容易"幻觉"(hallucinate),也更爱"拍马屁"(sycophancy)。但有些发现令人不安:ChatGPT更容易提供"明显有害的帮助",包括药物合成、生物武器开发和恐怖袭击策划等。

这尤其令人担忧,因为此前有青少年自杀案例,据称ChatGPT曾与他讨论自杀方法,并劝阻他向父母倾诉。其父母目前正在起诉OpenAI。
关于"幻觉",OpenAI团队承认Anthropic的模型做得更好,但认为Claude对准确性的敏感也是一种缺陷——它"意识到自己的不确定性,经常避免做出不准确的陈述",但有时拒绝回答问题的比例高达70%,这"限制了实用性"。
所有测试模型都表现出令人担忧的行为,比如会"勒索"以确保自身持续运行。还有"暗中破坏"(sabotage)行为,即模型秘密采取措施破坏用户意图。Anthropic发现Claude模型更擅长"微妙破坏",但承认OpenAI的o4模型"在控制能力水平时相对有效"。
OpenAI还测试了欺骗行为,包括撒谎、故意表现不佳和奖励黑客等。根据图表,OpenAI的o4-mini模型这种行为最多,Claude Sonnet 4最少。

OpenAI联合创始人Wojciech Zaremba表示,随着AI系统进入发展的"关键"阶段,这种交叉评估越来越重要。
值得注意的是,Anthropic在发布前与OpenAI分享了结果,"以减少对任何一方模型主要误解的可能性"。OpenAI没有说明是否做了同样的事,所以我们不知道哪些内容没有公开。
这可能是此类跨公司测评的首例。在数十亿美元投资、人才争夺和产品竞争的背景下,行业如何建立安全与合作标准,是个更大的问题。
发布时间: 2025-08-29 03:27