![图片[1]-OpenAI新模型o3/o4-mini“幻觉”更严重?越聪明越会胡说-搬主题](https://cdn.banzhuti.com/2025/03/20250305151948913.jpg)
OpenAI 最近推出的 o3 和 o4-mini 这两款 AI 模型,在很多方面确实代表了当前最先进的水平,特别是在需要“思考”和“推理”的任务上。然而,一个长期困扰 AI 领域的难题——幻觉(Hallucination),不仅没有在这些新模型上得到改善,反而似乎变得更加严重了!
什么是 AI 幻觉?
简单来说,就是 AI 模型会“编造”事实,自信满满地说出一些完全错误或不存在的信息,但语气却像真的一样。这个问题一直是 AI 发展中的一大挑战,即使是目前表现最好的系统也难以完全避免。
新模型“幻觉”不减反增?
通常情况下,随着模型的迭代更新,大家期望新模型能在减少“幻觉”方面有所进步。但这次的 o3 和 o4-mini 似乎打破了这个规律。
根据 OpenAI 自己的内部测试结果显示:
- o3 和 o4-mini 这两个所谓的“推理模型”(Reasoning Models),产生幻觉的频率,高于 OpenAI 之前的推理模型(如 o1、o1-mini、o3-mini)。
- 甚至也高于 OpenAI 传统的、“非推理”的模型(如我们熟悉的 GPT-4o)。
更让人担忧的是:OpenAI 自己也不完全清楚为啥会这样!
在其为 o3 和 o4-mini 发布的技术报告中,OpenAI 坦诚地写道,“需要更多的研究”来理解为什么随着推理模型规模的扩大,幻觉问题反而变得更糟。
报告指出,虽然 o3 和 o4-mini 在某些领域(如编码和数学任务)表现更好,但因为它们整体上会“做出更多的陈述”,这导致它们既能做出“更多准确的陈述”,同时也做出了“更多不准确/产生幻觉的陈述”。简单来说,就是话说得多了,对的多了,错得自然也多了?
具体数据佐证:
- 在一个名为 PersonQA(OpenAI 内部用于衡量模型关于人物知识准确性的基准)的测试中,o3 对 33% 的问题产生了幻觉。这个比例大约是其前辈 o1 (16%) 和 o3-mini (14.8%) 的两倍!
- 而 o4-mini 在 PersonQA 上的表现更差,产生幻觉的比例高达 48%!将近一半的回答是“胡编乱造”的!
第三方研究也发现了问题:
一个非营利 AI 研究实验室 Transluce 的测试也发现,o3 倾向于编造它在得出答案过程中所采取的行动。举个例子,Transluce 观察到 o3 声称它在一台 2021 年的 MacBook Pro 上“在 ChatGPT 之外”运行了代码,然后把结果复制到了回答中。但实际上,虽然 o3 可以调用一些工具,但它根本做不到这种操作。
Transluce 的研究员、前 OpenAI 员工 Neil Chowdhury 推测:“我们假设,用于 o 系列模型的那种强化学习方式,可能会放大那些通常在标准训练后流程中被缓解(但并未完全消除)的问题。”
Transluce 的联合创始人 Sarah Schwettmann 补充说,o3 的高幻觉率可能会降低其实用性。
业界人士的观察:
斯坦福大学的兼职教授、技能提升初创公司 Workera 的 CEO Kian Katanforoosh 表示,他的团队已经在测试 o3 用于编码工作流,并发现它确实比竞争对手更胜一筹。但是,他也提到 o3 倾向于产生无效的网站链接。模型会提供一个链接,但点击后却打不开。
“幻觉”的两面性与商业应用的挑战
虽然 AI 的“幻觉”有时也能激发一些有趣的创意(毕竟“胡思乱想”也是创造力的一种体现?),但对于那些极其注重准确性的商业应用场景来说,这无疑是一个巨大的障碍。想象一下,一家律师事务所肯定不希望 AI 在客户合同里插入一堆事实错误吧?
解决之道?网络搜索或许有帮助
一个有希望提高模型准确性的方法是赋予它们进行网络搜索的能力。例如,具备网络搜索能力的 OpenAI GPT-4o 在另一个准确性基准 SimpleQA 上达到了 90% 的准确率。理论上,搜索能力也可能改善推理模型的幻觉率——至少在用户愿意将提示暴露给第三方搜索提供商的情况下。
未来挑战:如果“越聪明越会胡说”成真?
如果扩大推理模型的规模确实会持续加剧幻觉问题,那么寻找解决方案就变得更加紧迫了。
OpenAI 的发言人 Niko Felix 表示:“解决我们所有模型的幻觉问题是一个持续的研究领域,我们正不断努力提高它们的准确性和可靠性。”
这次 OpenAI 新模型幻觉不减反增的情况,确实给火热的 AI 领域泼了一盆不大不小的冷水。它提醒我们,AI 的发展并非一帆风顺,在追求更高性能的同时,一些基础性的难题依然亟待解决。
- 推理模型的“双刃剑”效应: 推理能力让 AI 在复杂任务上表现更好,但也可能打开了更多“胡说八道”的空间?这其中的平衡点在哪里,还需要深入研究。
- 准确性仍是核心痛点: 无论 AI 多么能说会道,多么擅长编码,如果不能保证基本的事实准确性,其在许多关键领域的应用价值就会大打折扣。
- 解决方案任重道道: 无论是通过引入外部知识(如网络搜索),还是改进训练方法和模型架构,解决幻觉问题依然是 AI 研究的重中之重。
咱们搬主题认为,AI 的发展就像是在爬一座很高的山,每前进一步都可能遇到新的挑战。这次 o3/o4-mini 的幻觉问题,就是摆在 OpenAI 乃至整个行业面前的一道坎。希望研究人员能尽快找到有效的解决方案,让 AI 在变得更聪明的同时,也变得更可靠、更值得信赖。你对 AI 的“幻觉”问题怎么看?你遇到过 AI 胡说八道的情况吗?欢迎在评论区分享你的经历和看法!
























暂无评论内容