GPT-5也有“舌尖现象”?谷歌450万次测试揭秘模型知识提取难题

   时间:2026-08-15 00:11 来源:快讯作者:柳晴雪

你是否经历过这样的场景:明明知道某个答案就在嘴边,却怎么也想不起来具体内容?心理学上将这种现象称为“舌尖现象”。如今,谷歌最新研究发现,GPT-5和Gemini 3这两款先进的人工智能模型,竟也面临类似的困境。

在谷歌的研究中,这两个模型虽然将95%至98%的测试事实存储在参数中,但当直接询问时,却有26%至34%的内容无法正确回答。即使让模型“多思考一会儿”,仍有11%至12%的事实无法被提取出来。这表明,模型并非没有学习到这些知识,而是无法有效调用。

这项名为《空货架,还是丢钥匙?》的研究被收录于ICML 2026,并于近期由Google Research通过博客详细介绍了成果,同时公开了名为WikiProfile的基准测试和完整数据集。研究指出,模型回答错误的原因可能有两类:一类是知识未被学习,另一类是知识已学习但无法提取。传统方法往往将这些问题归结为准确率不足,而谷歌提出的“知识画像”框架则通过划分五种状态,更细致地分析模型对知识的掌握情况。

这五种状态包括:存入失败、回忆失败、直接回忆、借助思考回忆以及未存入但通过推理答对。研究通过截断维基百科原文并让模型补全,或在相同上下文中直接提问,来判断知识是否被存入。这些测试均不允许模型“多思考”,以区分记忆与推理的结果。

WikiProfile基准测试包含2150条事实,均取自英文维基百科。每条事实配有10道题目,包括2道测试知识存入、4道直接回答和4道选择题,总计21500道题目。题目由Gemini-2.5-Pro生成,并通过Google搜索验证,人工最终审核后剔除了不到2%的题目。测试覆盖了13个模型,每个模型在开启和关闭“思考”功能的情况下各运行一次,每道题目采样八次,共收集约450万条回答。完整测试一个前沿模型的成本约为500美元。

研究结果显示,在前沿模型的事实错误中,“无法提取”已成为主要问题。冷门知识是导致这一现象的首要原因。数据显示,冷门知识的存入率与热门知识相差无几,但回忆率却显著低于热门知识。例如,Gemini-3-Pro的冷门知识存入率为94.5%,热门知识为99.5%,但回忆率分别为63.3%和84.7%。GPT-5的差距更大,冷门知识存入率为90.7%,热门知识为98.4%,但回忆率仅为52.9%和77.8%。这表明,冷门知识虽然被存储,但更难被调用。

另一个典型场景是反向提问。例如,模型可以快速回答“汤姆·克鲁斯的妈妈是谁”,但当被问“这位女士的儿子是谁”时,却常常卡壳。这种现象被称为“反转诅咒”。谷歌通过将问题改为四选一的形式发现,模型可以正确回答选择题,但无法回答开放式问题。这表明,模型存储知识时,语境、措辞和顺序也被一并保留,导致提问方式稍有变化,模型就无法匹配答案。

研究还发现,“多思考”功能显著提升了模型提取已存储知识的能力。对于已存储但无法直接回答的事实,开启“思考”后,模型可以找回40%至65%的内容。相比之下,未存储的事实仅能找回5%至15%。这表明,“思考”并非通过推理得出答案,而是帮助模型更有效地调用已有知识。谷歌的另一篇姊妹论文《思考以回忆》解释了这一机制:思考过程中的中间内容为模型提供了额外的计算缓冲,同时通过激活相关事实,搭建了通往正确答案的语义桥梁。

然而,这种方式也有潜在风险。如果思考过程中涉及的中间事实是错误的,最终答案的错误概率反而会更高。这类似于人类认知中的“扩散激活”现象:当无法直接回忆某个名字时,通过回忆相关线索,名字可能会自然浮现,但如果线索错误,回忆也会偏离正确方向。

研究还指出,扩大模型规模虽然可以增加知识存储量,但无法显著提升知识提取能力。以开源的Gemma 3家族为例,参数从1B增加到27B,编码失败率从85%降至23%,但回忆失败率并未同步下降,反而在剩余错误中的占比持续上升。在前沿模型中,这一现象更为明显:回忆失败占GPT-5.2全部错误的七成以上,且模型越强大,这一比例越高。

这并不意味着扩大规模失去意义,而是表明其效果存在边界。既然知识存储比例已接近95%至98%的天花板,继续增加参数和数据带来的准确率提升将逐渐减小。未来的改进可能更多依赖于后训练和推理方法,即如何更有效地利用已存储的知识。虽然检索增强技术可以部分弥补这一不足,但参数中的知识仍对流畅性、响应速度和跨语境整合至关重要,难以被外部检索完全替代。

那么,何时应该让模型“多思考”呢?研究将这一问题定义为元认知,即模型需要先判断自身状态,意识到“我无法直接回答”,才能决定是否开启“思考”功能。

 
 
更多>同类内容
全站最新
热门内容