ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Frontier LLMs Still Struggle with Simple Reasoning Tasks

Frontier LLMs Still Struggle with Simple Reasoning Tasks 文章主要内容总结本文聚焦前沿大型语言模型(LLMs)在简单推理任务中的表现,通过实验发现:尽管最先进的LLMs(包括所谓的“思考模型”)在复杂数学、编程等任务上表现优异,但在人类看来简单的推理任务中仍频繁失败。研究通过两方面展开:程序性生成的简单推理任务:设计了计数(字符/单词计数)、一阶逻辑(公式评估与否定)、基于证明树的数学应用题、旅行规划等任务,这些任务可通过调整参数(如文本长度、变量数量)增加计算量,但保持核心推理难度不变。实验发现,随着任务“繁琐度”上升,LLMs因统计捷径、中间步骤错误、长上下文处理困难等原因表现显著下降。Unpuzzles数据集:该数据集包含97个知名逻辑谜题及其“简化版”(unpuzzles),以及64个逻辑结构相同但语境不同的“语境迁移简化版”。结果显示,LLMs在原始谜题上表现优异,但在简化版上失败率高,且在语境迁移简化版上表现更好,说明其失败源于对原始谜题的记忆,而非推理能力不足。研究揭示,即使是最新的“思考模型”,在分布外泛化、简单推理任务上仍存在缺陷,且任务难度降低未必带来性能提升。文章创新点全面评估前沿LLMs的简单推理能力:首次系统评估了包括OpenAI o1、Gemini 2.5 Pro等在内的前沿模型(含“思考模型”)在多种简单推理任务上的表现,证明其失败具有普遍性。程序性生成任务设计:提出带可调参数的程序性生成任务,可灵活控制
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进