OmniTools 8月13日消息,Google Research 发布新研究,提出“知识画像”分析框架,指出当前前沿大语言模型(如 Gemini 3、GPT-5)的事实编码能力已接近饱和,但回忆(recall)能力明显不足。研究将事实错误归因于“丢钥匙”(即无法检索已编码知识),而非“空货架”(即未编码相关知识)。
该框架将事实处理过程细分为编码失败、回忆失败等五类错误画像,并同步推出 WikiProfile 基准测试集,包含 2,150 条维基百科事实,每条事实配套 10 个问题,分别评估模型的编码、回忆与识别能力。