新智元报道
那个名字明明就在嘴边。
你看到一张熟脸,却死活想不起他的名字,心理学给这种现象起过一个名字:「舌尖现象」(tip-of-the-tongue)。
【资料图】
现在,谷歌在一项研究里发现,GPT-5和Gemini 3也有同一种毛病。
这两个模型把95%–98%的测试事实都装进了参数里。可你直接去问,它们却有26%–34%的事实答不出来。
开启thinking多想一会儿,还剩11%–12%怎么也想不起来。
大模型答不出来,很多情况下真不是它大脑里没有,是学过了,取不出来。
这项研究叫《空货架,还是丢钥匙?》(Empty Shelves or Lost Keys?),收录于ICML 2026。
8月12日,Google Research发博客把结果集中讲了一遍,同时公开的还有一套名叫WikiProfile的基准和完整数据集。
货架没空
钥匙丢了
模型答错题,可能是两种毛病。
一种是压根没学过,那得往预训练里加数据、加参数;另一种是学过了,换个问法就调不出来,那是后训练和推理环节的事。
这两种问题,都曾被归结为一个准确率的问题。
谷歌提出的「知识画像」框架,不再问「这道题答对没有」,而是判断「这条事实在这个模型记忆中处于什么状态」,一共划分出五种。
「知识画像」把一条事实分成五种状态:存入失败、回忆失败、直接回忆、借助thinking回忆、未存入却靠推理答对。
同样一个错误答案,在不同的状态,修改方法也完全不同。
怎么判断一条事实存没存进去?
办法是把维基原文截到答案出现之前,让模型顺着写下去;或者在同样的上下文后面直接发问。
这两道题都不许开thinking,为的是把「记住了」和「推出来的」分开。
左侧测存没存进去,把维基原文截断让模型补完;右侧测答不答得出,换措辞、换正反方向反复提问。
基准叫WikiProfile,一共2150条事实,全部取自英文维基百科。
每条事实配10道题:2道测存没存进去,4道让它自己答,4道给选项挑。加起来21500道题。
出题全交给了模型:Gemini-2.5-Pro生成,Google搜索逐题验证,答案不唯一或题目有歧义的,连带整条事实一起丢弃。最后人工再验一遍,又砍掉不到2%。
跑分的是13个模型,覆盖Gemini 3、GPT-5、GPT-4.1和Gemma 3四个家族,每个模型开关thinking各跑一遍,每道题采样八次,攒出约450万条回答。
把一个前沿模型完整测一遍,大概要花500美元。
结果就是开头那组数字。
在前沿模型的事实错误里,「取不出来」已经压过了「没学过」,成了大头。
取不出来的
都卡在同两个地方
第一个是冷门知识。
过去的主流解释是模型容量不够,一些冷门事实压根没学进去。
这次的数据,冷门知识其实都存进去了。Gemini-3-Pro存下了94.5%的冷门事实,热门事实是99.5%,只差5个点。
可一开口回答,冷门事实就掉到63.3%,热门事实还有84.7%,差了21个点。
存的时候几乎没差别,取的时候差出四倍。
冷门事实(后20%)与热门事实(前20%)对比,存入率差距很小,直接回忆率差距明显拉开。
GPT-5的落差更大。
冷门事实它存住了90.7%,热门事实98.4%。可一开口,冷门事实只剩下52.9%,热门事实还有77.8%。
将近一半的冷门事实明明躺在模型里,就是调不出来。
存入的时候差别不大,取的时候差别很大。长尾问题的真相,不是模型没见过那些冷门事实,是那些知识更难被叫醒。
第二个场景是反向提问,你问AI,汤姆·克鲁斯的妈妈是谁,它答得又快又准。你反过来问,这位女士的儿子是谁,它就卡壳了。
2023年那篇论文给它起名叫「反转诅咒」,模型学会了「A是B」,不会自动泛化出「B是A」。当年的解释是:双向关联压根没被学进去。
谷歌把同一批题改成了四选一,结果马上反转。
GPT-5正向问答的回忆率是82.9%,反向掉到74%。可一换成给选项的识别题,反向不但不比正向难,13个模型里有9个反而答得更好,剩下4个持平。
选择题会做,一换成问答题就答不出来了。
同一批正反向问题,四选一识别里反向不比正向难,闭卷生成里反向明显更难。
这说明那层关联显然是在的,真正卡住的是怎么把它挖出来。
作者的解释是,事实被存进去的时候,当时的语境、措辞和顺序也一并留在了里面。
你问的方式一旦偏离训练时的样子,钥匙就对不上锁。
thinking的另一个身份
帮它回忆
WikiProfile里的题,都是问一句答一句,中间没有推理步骤。
「Oasis第一场演出在哪个俱乐部」,这种题要么记得,要么不记得。
按理说让模型多想一会儿,也帮不上什么忙。
但thinking真捞回来了。那些存进去却答不出的事实,它找回了40%–65%。
关键线索,藏在它的偏好上:那些压根没存进去的事实,thinking只能捞回5%–15%。
开启thinking后被找回的事实比例,已存进参数的能捞回40%–65%,没存进去的只有5%–15%。
它不是在凭别的知识推演,是在原地找钥匙。
作者还顺手排除了一个更省事的解释。
有人会想,thinking无非是让模型答得更花,八次里蒙中一次的机会变大了。真是这样的话,答案应该更飘才对。
实际反过来了,开了thinking,同一道题八次里答对的次数反而更集中。
收益最大的两处,恰好是前面最堵的那两处。
Gemini-3-Pro的冷热门差距从21.4个点收窄到12.5个点,GPT-5的正反向差距从9个点收窄到2个点。哪儿最堵,它就往哪儿使劲。
谷歌另一篇姊妹论文《思考以回忆》(Thinking to Recall)给出了机制解释:
一是计算缓冲,那些吐出来的思考token哪怕内容本身没什么意义,也在给模型争取额外的隐式算力;
二是事实启动,模型先说出一批相关事实,等于给正确答案搭了一座语义桥。
这在人类认知里叫「扩散激活」(spreading activation)。
想不起某个人的名字,就先回忆他在哪家公司、留什么发型、上次见面是什么场合,名字常常自己就冒出来了。
摆脱「舌尖现象」的办法,人和模型居然是同一套。
但这种方式也有代价。
同一篇论文警告:如果思维链里那些中间事实是编的,最终答案的幻觉概率反而更高。
桥搭歪了,走得越远错得越离谱。
扩规模等于补货
不负责配钥匙
拿开源的Gemma 3家族当尺子。
参数从1B涨到27B,编码失败率从85%一路降到23%。
规模确实在补货,货架肉眼可见地被填满了。可回忆失败没有同步下降。它在剩余错误里的占比一路上升,到27B时成了错误的主要构成。
放到前沿模型上更极端:回忆失败占了GPT-5.2全部错误的七成以上,而且模型越强,这个比例越高。
13个模型的五种状态分布,参数越大编码失败一路收缩,回忆失败几乎不动。
规模改善的是存了多少,不是取得出多少。
这并没有给scaling判死刑,而是给它划了一条边界。
既然存进去的比例已经摸到95%–98%的天花板,那么继续加参数、加数据,能换来的准确率提升正在肉眼可见地变小。
下一段增益更可能来自后训练和推理时的方法,也就是怎么用好已经存进去的知识。
检索增强当然能补位。
但作者也提醒道:参数里的知识仍然关系到流畅度、响应速度和跨语境整合,很难被外部检索完全替代。
它得先知道自己想不起来
那么,什么时候该让模型多想一会儿?
论文把这个问题定义成了元认知,也就是模型对自己状态的判断:它得先意识到「我直接答不上来」,才知道这道题值得开thinking多想一会儿。
过去两年,让模型更靠谱的默认答案是喂更多数据、堆更大参数。
这项研究把话说清楚了:事实层面,前沿模型的货已经上架得差不多了。接下来考验的,是它能不能自己把货取出来。
更麻烦的是下一步:它得先知道,自己想不起来。
参考资料:
https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/
https://aihot.virxact.com/items/cmsqe6mat01bsroli3hw71nz7
编辑:元宇
为您推荐
- (2026-08-14)淘气天尊:现在抄底?你问过主力了吗?
- (2026-08-14)快资讯丨迈富时早盘涨逾7% 上半年净利润同比大增4.6倍至2.0亿元
- (2026-08-14)广东华兴银行:行长职美琴因身体健康原因辞任-观点
- (2026-08-14)4000万欧的离别:卡萨多告别巴萨,沙特淘金背后的红蓝中场洗牌_焦点播报
- (2026-08-13)百润股份:8月12日刘晓东、刘嘉瑞、喻晨、马良增持股份合计76.82万股_速读
- (2026-08-13)每日热议!生意社不锈钢8月13日均差为-51.33元/吨 由负向扩大转为缩小
- (2026-08-13)关乎每家每户!通辽物业新规正式实施
最近更新
- (2026-08-14)GPT-5也会话到嘴边想不起来!谷歌测了450万次:钥匙丢了
- (2026-08-14)记者:纽卡可以签格雷茨卡,这会释放积极信号
- (2026-08-14)焦点播报:哈利伯顿盛赞威少 称其入无冠前三
- (2026-08-14)生意社:8月14日华东地区二甲苯市场价格下调
- (2026-08-14)科源制药(301281)8月13日主力资金净卖出100.40万元
- (2026-08-14)议程公布丨9月3日广州见!第七届媒介力学论坛·广州场报名开启 每日速读
- (2026-08-14)淡季来临 钨矿行业上市公司订单以刚需为主|聚焦
- (2026-08-14)2026乌镇戏剧节25部特邀剧目,8月22日首轮开票!
- (2026-08-14)焦点热议:【环球财经】伦敦金属交易所基本金属13日涨跌互现
- (2026-08-14)即时:ST华闻(000793.SZ)新增一起对外投资,被投资公司为海南安可充充电科技有限公司
- (2026-08-13)太阳报:雅克松更倾向于留在切尔西,为自己的位置而战_每日快报
- (2026-08-13)飞霓控股(08480.HK):Andrew Chan Lim-Fai由执行董事调任为非执行董事
- (2026-08-13)微动态丨曼城在下一盘更大的棋
- (2026-08-13)每日速读!IGG(00799)将于9月14日派发特别股息每股0.082港元
- (2026-08-13)龙旗科技:拟11.2亿元收购安瑞可80%股权 观热点
- (2026-08-13)山西运城恒龙200兆瓦/400兆瓦时储能项目并网!_微头条
- (2026-08-13)今日报丨颀中科技最新公告:总经理提议回购7500万元至1.5亿元股份
- (2026-08-13)官方:曼联20岁前锋伊森-威廉斯转会加盟彼得堡联
- (2026-08-13)每日播报!PriceSeek提醒:国内丙烯腈周度产能产量双升
- (2026-08-13)观热点:罗体:库普梅纳斯已从建队核心变成边缘人,尤文想甩卖
- (2026-08-13)生意社:8月13日吕梁市场铸造焦价格暂稳运行
- (2026-08-13)每日热讯!【新华500】新华500指数(989001)13日跌0.67%
- (2026-08-13)中保研发布最新汽车零整比研究结果:新能源汽车维修负担指数降约14% 焦点消息
- (2026-08-13)持续降雨影响交通出行 三省市12个路段封闭管控-视讯
- (2026-08-13)博苑新材:截至2026年8月10日,公司股东总户数为10,298户
- (2026-08-13)每日快播:大行评级|瑞银:电能实业上半年业绩大致符合预期,目标价升至73港元
- (2026-08-13)法布雷加斯:阿森纳如今的成就证明了阿尔特塔的价值|每日头条
- (2026-08-13)哈维出任荷兰男足国家队主教练
- (2026-08-13)牧民的餐桌更丰盛_速看料
- (2026-08-13)观天下!阿尔特塔笑晕!阿森纳 7500 万新援首秀封神!枪迷集体沸腾

辛有志严选的模式会缔造一个新的传奇?
阿富汗“塑料衣”男孩美梦成真:获梅西签名球衣(图)
特朗普选情高歌猛进 引发美国共和党人日渐不安