首页
模型资源
新药研发
资源中心
科研工具
关于我们
商城
集团站群
CN

Trends in cognitive sciences
大语言模型预测能力超越人类:记忆机制差异导致认知建模偏差

2026-08-01
加入邮件订阅!
您将获得赛业生物最新资讯
摘要速览
Trends in cognitive sciences | 大语言模型预测能力超越人类:记忆机制差异导致认知建模偏差

小赛推荐:

该研究揭示了大语言模型在语言预测任务中表现出‘超人类’能力,主要源于其远超人类的长期与短期记忆机制。这一发现为设计更贴近人类认知的模型提供了关键指导,尤其对自然语言处理和认知建模领域的实验设计具有直接启发。

 

文献概述

本文《To model human linguistic prediction, make LLMs less superhuman》,发表于《Trends in cognitive sciences》杂志,系统探讨了当前大语言模型(LLMs)在模拟人类语言理解过程中的局限性。作者指出,尽管LLMs在下一词预测任务上表现卓越,但其预测模式与人类阅读行为的对齐度却在下降,原因在于模型的记忆能力远超人类。这种“超人类”特性使其无法准确反映人类真实的语言预测机制。文章进一步提出,应通过调整训练策略与模型架构,使LLMs具备更接近人类的记忆特性,以提升其作为认知模型的有效性。

背景知识

该研究解决的语言理解痛点在于:现有大语言模型虽能高效完成语言任务,但其内部机制与人类大脑处理语言的方式存在根本差异,导致其难以作为真实认知过程的代理模型。目前LLM的研究瓶颈在于,模型优化目标通常仅追求预测准确性,而忽视了与人类心理现实性的对齐。例如,人类在阅读时依赖有限的知识储备和易衰减的短期记忆,而LLMs却能完美记住训练数据中的事实与长距离上下文,造成预测偏差。选题切入点在于从“记忆机制”角度重新审视LLMs的认知模拟能力,提出通过控制模型对知识记忆和上下文记忆的保留程度,使其更贴近人类读者的心理现实。这一路径为构建真正可解释、可验证的神经认知模型提供了新方向。

 

针对神经退行性疾病如阿尔茨海默症、帕金森病等的基因编辑模型、人源化模型和药物诱导模型,提供精细化注射给药与行为学实验服务,支持神经药效评价与基因治疗研究。

 

研究方法与核心实验

作者通过综述近年来语言模型与人类阅读行为对齐研究的实证数据,系统分析了LLMs预测概率与人类阅读时间之间的关系变化趋势。研究对比了早期n-gram模型、中等规模神经语言模型与当前主流Transformer架构LLMs在解释眼动数据、自定步调阅读时间等方面的表现。关键证据来自多项实验发现:更大规模的LLMs对专有名词(如Tupelo)或重复文本的预测概率远高于人类实际阅读流畅度所反映的预期,表明其依赖于精确事实记忆和长程上下文复制机制。此外,通过干预LLMs注意力机制(如限制上下文窗口、调整注意力权重),研究发现当模型对早期词元的记忆被削弱时,其预测与人类阅读难度的对齐度显著提升,支持了“记忆衰减”是人类语言处理的重要特征这一假设。

关键结论与观点

  • 主流大语言模型因训练数据量巨大且记忆机制无衰减,导致其对词汇的预测远超人类水平,形成“超人类”现象。[数据发现] + [对后续认知建模的指导意义]
  • LLMs的长期记忆优势使其能准确预测依赖特定事实的知识性内容(如“Elvis Presley was born in the city of Tupelo”),而多数人类读者缺乏该知识或已遗忘。[数据发现] + [对后续知识编辑的指导意义]
  • LLMs近乎完美的短期记忆使其在处理回指、重复表达和句法消歧时表现优于人类,例如在处理“the rat the cat the dog chased loved...”这类深层嵌套句时未表现出相应阅读困难。[数据发现] + [对后续句法处理模型的指导意义]
  • 通过限制模型对先前词元的访问(如局部注意力、近期偏置)或降低向量表示维度,可使LLMs预测更接近人类阅读模式。[数据发现] + [对后续模型架构设计的指导意义]
  • 采用人类规模训练数据(如BabyLM Challenge)或引入温度缩放、语义相似词增强等训练目标,有助于使LLMs预测分布更“弥散”,模拟人类基于语义泛化而非精确匹配的预测方式。[数据发现] + [对后续训练策略优化的指导意义]

研究意义与展望

该研究从根本上挑战了“更强LLM即更好认知模型”的默认假设,强调模型的心理真实性应成为评估指标之一。对于药物开发而言,类似方法论可用于构建更真实的神经语言障碍(如失语症、自闭症谱系)患者的语言处理模型,辅助诊断工具开发。

在临床监测中,基于人类记忆特性的LLM可用于分析患者语言产出中的预测偏差,作为认知衰退的早期行为标志。例如,阿尔茨海默病患者常出现词汇查找困难,若LLM能模拟正常与受损记忆机制,则可量化其语言非流畅性来源。

对于疾病建模,该研究倡导的“降级记忆”策略可推广至其他模态认知建模。例如,在视觉场景理解中,构建具有有限视觉工作记忆的模型,可能更真实地模拟人类注意力机制,提升人机交互系统的可解释性与安全性。

 

提供基于HUGO-GT®全基因组人源化小鼠模型的临床前研究平台,适用于脊髓性肌萎缩症、阿尔茨海默病、雷特综合征等罕见病的基因治疗药物开发,支持突变定制与药效评价。

 

结语

从实验室到临床转化的视角来看,这项研究为连接人工智能与认知神经科学提供了坚实桥梁。它提醒我们,模型的“能力”不等于“真实性”。在构建用于理解人类语言障碍、精神疾病或神经退行性疾病的计算模型时,必须将心理与神经现实性置于核心位置。通过引入人类记忆的局限性——包括知识遗忘、注意力衰减和语义泛化机制——我们可以开发出不仅准确,而且可解释、可干预的下一代认知模型。这些模型将成为研究阿尔茨海默病、精神分裂症等疾病语言表型的重要工具,助力早期筛查、机制解析与个性化干预策略设计。最终,这种“去超人类化”的建模范式有望推动精准认知医学的发展,使AI真正成为理解人类心智的伙伴而非对手。

 

文献来源:
Byung-Doh Oh and Tal Linzen. To model human linguistic prediction, make LLMs less superhuman. Trends in cognitive sciences.