|

起航网
2000活跃值=1元

首页 > 科技知识 > 科技知识 > 苹果拆解AI大脑，推理模型全是「装」的？Bengio兄弟合著

苹果拆解AI大脑，推理模型全是「装」的？Bengio兄弟合著

发布时间：2025-06-07 18:08:15

　AI「思考」只是假象？

　　刚刚，一项来自苹果的重磅研究揭示了「大推理模型（LRM）」背后的惊人真相——这些看似聪明的模型，在面对稍复杂点的题目时，准确率居然会全面崩溃！

　　随着问题变难，推理模型初始会延长思考，但随后思考深度反而下降，尽管仍有充足token预算——它们恰在最需要深入思考时选择了放弃！

　　这太违背直觉了，似乎Scaling Law在推理时完全失效了。

　　值得一提的是，论文作者中还有Samy Bengio，他也是图灵三巨头Yoshua Bengio的兄弟。

苹果拆解AI大脑，推理模型全是「装」的？Bengio兄弟合著

　　论文地址：https://ml-site.cdn-apple.com/papers/the-illusion-of-thinking.pdf

　　LRM模型因能「写出思考过程」而备受期待，被认为是AI推理能力跃升的关键。

苹果拆解AI大脑，推理模型全是「装」的？Bengio兄弟合著

　　DeepSeek-R1 模式的开源开启了LLM进化到LRM的进程

　　但研究人员通过可控游戏环境的系统实验证明：现有LRMs不仅在高复杂度任务上力不从心，甚至还展现出一种「反常的推理崩溃曲线」——题目越难，它们反而越不「努力」。

　　研究还通过在相同计算token预算下对比思考模型与普通模型，发现：

　　不同于大多数仅衡量最终性能的研究，这项最新研究分析了它们实际的推理轨迹——深入观察其冗长的「思考」过程。

　　三种不同的性能区间

　　与以往主要依赖数学问题来评估语言模型推理能力的研究不同，本研究引入了可控的解谜环境。

　　这种环境可以精确调节问题的复杂度，同时保持逻辑过程的一致性，从而更严谨地分析模型的推理模式和局限性。

苹果拆解AI大脑，推理模型全是「装」的？Bengio兄弟合著

【返回列表】

特别声明：以上内容(如有图片或视频亦包括在内)为“起航网用户上传并发布"，本平台仅提供信息存储服务。

下一篇:苹果WWDC前瞻：操作系统全面换新，AI更新有限，Siri升级仍缺席

上一篇:孝义市老促会与红苹果幼儿园：传承红色基因点亮教育未来

科技知识更多>>

2025年底，马自达CX-5跨界SUV全球累计生产与销售量均达到500万辆马斯克刚脱口而出，特斯拉便紧急提交“Cybercar”与“Cybervehicle”商标申请铭纳阳新能源汽车驱动电机及其核心零部件研发、生产项目正式奠基传奇掌舵人今日退休，Xbox正式死去啊？今年春节，爸妈反过来教我用 AI？微雪电子7英寸圆形触摸面板，功能超强大 Urus SE Performante路测图曝光：兰博基尼最强SUV 获10亿美元种子轮融资！前DeepMind首席科学家离职创业：绕过大模型探索超级智能特斯拉将在美加对部分辅助驾驶功能收取订阅费哪吒汽车印尼业务调整：本土销量数据全披露 Waymo在迈阿密启动付费无人驾驶出租车服务，成为美国第六个运营城市 1月26日，鸿蒙智行官方宣布，旗下的尚界H5车型累计交付已突破3万辆保时捷最硬核 911：尾翼与引擎盖尽展锋芒吉利目标 2030 年新能源汽车销量占比达 75% 现代汽车集团2025年在美市场份额达11.3%，创历史新高 “极狐vs深蓝”AI通稿泛滥，双方作出回应长城汽车发布全球首个原生AI全动力汽车平台“归元” OpenAI致信投资者称马斯克将发表“离谱言论” 华为车BU CEO靳玉志：预计今年搭载华为ADS车型数超过80款罗永浩回应“西贝贾国龙今晚10点对线”：突然有点心酸奥特曼要给你的脑子装上GPT 曾经自研L3，高举大旗的奔驰，现如今一手Momenta，一手英伟达，要么L2，要么L4… 庭审在即：OpenAI提醒投资人马斯克或提出“夸张指控” Meta放弃“元宇宙办公”愿景，2月起不再面向企业销售头显及服务火影忍者手游：新S忍的武器是方天画戟，这是来了一个吕布？一块3000的签绘板，被炒到5万！同人作者终于还是被黄牛上了一课山东青年海外考的公务员，“含金量”比国内低多了江浙沪富家女与企二代联姻如此甜，比撒糖戏码更有看头的是赵今麦的穿搭！中国建筑材料流通协会秦占学解读行业机遇：反内卷、促出海、寻“光”前行中央定调明年继续“国补”、前11月家具出口总额下降5.1%、家居A股控制权变更潮起

Copyright 2017-2025 起航网版权所有京ICP备19012569号-1