00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

智东西
作者 | 杨京丽
编辑 | 李水青
智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。
以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。
这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。
换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。 强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。
这一发现来自论文《 基础模型可以借助训练数据中的线索进行推理 (Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。
论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已 先后在ICML和NeurIPS上发表研究成果 。
论文链接:
https://arxiv.org/abs/2610.06851
项目链接:
https://www.sophielwang.com/cues
开源地址:
https://github.com/sophicle/cues
一、回答开头只改两个token,基础模型准确率追平强化学习版本
论文将模型回答拆分为“开头token线索”和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。
他们首先观察Olmo-3-7B在MATH-500上的回答。 正确答案中,约有50%的回答以“.\n\n”(句号加两个换行)开头,错误答案中这一比例只有14%。 句号和换行本身没有提供数学知识,却与正确率出现了明显关联。
研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。
对Olmo-3-7B,最终选中的开头是“.\n\nOkay”;对Qwen3-14B,选中的是“ Alright,”。 研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。
在MATH-500上,Olmo-3-7B基础模型自行生成回答开头时,其准确率约为 42% ;将回答开头固定为“.\n\nOkay”后,准确率升至约 78% ,高于其强化学习版本约 75% 的成绩。
Qwen3-14B使用“ Alright,”作为回答开头后,准确率则 从72%提高到87% ,与强化学习版本持平。相同开头还被用于GSM8K、AMC 23、AIME 2024等数学测试, 在多数测试中都能带来提升 。在代码生成测试HumanEval上,固定开头提高了Olmo-3-7B的成绩;Qwen3-14B的成绩则与不固定开头时相近。
论文中展示了一道具体题目的生成差异。题目较为简单,要求计算 834名学生占全校人数三分之二时,全校共有多少名学生 。
当模型以“.\nAnswer”开头时,它直接给出“1002”,答案错误;当模型以“.\n\nOkay”开头时,它先列出 “(2/3)×T=834”,计算出1251 ,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。
二、从14%升至65%,强化学习先改变模型的回答开头
如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?
研究者采用RL-Zero设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现, 两者预测分布的最大差异集中在回答最开始的两个token 。
对Olmo-3-7B,强化学习将“.\n\nOkay”的生成概率 从0.14提高到0.65 ;对Qwen3-14B,“ Alright,”的生成概率 从0.04提高到0.58 。强化学习前后,模型的预测差异主要集中在回答最开始的两个token,之后差异明显减小。
研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B在这种条件下可以达到强化学习模型的准确率。
训练曲线显示,预先固定有效开头后, Olmo模型的成绩大约相当于标准强化学习训练100步后的水平,Qwen模型则相当于约50步后的水平。
这说明,在这组实验中, 强化学习的一部分作用可能是提高模型选择有效推理开头的概率 ,让它更容易进入原本已经存在的推理路径。
研究者还控制了回答长度。 部分开头会让模型写出更长的回答 ,但准确率仍低于不固定开头的结果;在相同token预算下,“.\n\nOkay”仍保持优势。因此,成绩提升不能只用回答变长来解释。
三、训练数据改写词语关联,“Chicken”也能诱导推理
“Okay”为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。
他们 将Olmo模型中期训练数据里与推理轨迹共同出现的“Okay”替换为“Chicken” ,再从相同检查点继续训练。测试时,模型都被固定为以“.\n\nChicken”开头。
在原始基础模型中,固定“.\n\nChicken”后的MATH-500 准确率约为18% ,低于不固定开头时的42%。重新训练后,模型则会沿着推理文本的模式继续生成, 准确率升至77% ,接近“.\n\nOkay”开头的78%。
在使用10B-token中期训练数据的重训实验中,固定“.\n\nChicken”后,MATH-500准确率从2.4%升至37.2%;在使用100B-token数据的另一组实验中,准确率则从18.2%升至76.9%。两组实验的数据规模不同,但都说明, 重新建立“Chicken”与推理文本之间的训练关联后,这个词才具备了推理线索的作用 。
修改后的模型也没有忘记Chicken的日常含义。面对“A chicken is a”或“She roasted the chicken”这样的句子,它仍然可以生成与鸟类或食物有关的内容。
研究者还将训练数据中的 “step by step”替换成“duck duck goose” 。重新训练后, “Think duck duck goose”也能像“Think step by step”一样诱导模型推理 。
隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。“.\n\nOkay”更接近合成推理轨迹,“To”更接近解释型数学文本,“Answer”则更接近简短问答文档。研究者还发现, 线索越早出现在回答中,产生的影响越持久 ;等到第三至第六段才插入“Okay”,效果会明显下降。
四、修改回答开头,模型可能拒绝请求
此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。
在Olmo-3-7B中, 以“I’m sorry”开头的回答更容易拒绝请求 ,但也会增加对无害请求的误拒绝; “Okay,”会减少拒绝 ,并增加模型对危险请求给出有害内容的概率。
数学实验中有效的“.\n\nOkay”则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。
论文还发现, 仅仅改变空格、标点和换行方式,就可能带来不同结果 。“Okay,”和“.\n\nOkay”看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。
这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。
结语:模型能力和稳定发挥之间,还隔着一个“开头”
通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对Olmo-3-7B来说,只是在回答开头加上“.\n\nOkay”,准确率就从约42%提高到了78%。
“Chicken”的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,“Chicken”也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。
不过,需要注意的是,实验测试的模型主要为Olmo-3-7B和Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。
资讯由采集器定时从公开的机器人 / AI 信息源自动聚合。
相关内容

为什么灵活性是物理人工智能的真正瓶颈
机器人灵活性的下一个主要挑战是使整个系统足够可靠,以将功能转化为有用的工作。 《为什么灵活性是物理人工智能的真正瓶颈》一文首先出现在《机器人报告》上。

Agentic开发时代到来!鸿蒙PC三大原生开发工具公测,补齐国产操作系统生态关键短板
智东西 作者 | 程茜 编辑 | 漠影 当一台鸿蒙PC,既能跑鸿蒙应用,又能原生开发鸿蒙应用,会发生什么? 智东西10月10日报道,10月8日,可视化一站式IDE工具DevEco Studio、一站式鸿蒙应用AI开发工具DevEco Code与AI开发能力套件DevEco CLI,同步开启鸿蒙PC版公测。 三者分工明确:DevEco Studio主打集成开发、多端调试,承担基础IDE核心能力;DevEco Code提供端到端一站式Agentic开发体验;DevEco CLI对外输出鸿蒙开发能力,可无缝对接外部各类Agent工作流,让 AI 辅助开发融入鸿蒙 PC 原生环境。 DevEco三件套

编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光
智东西 编译 | 杨京丽 编辑 | 李水青 智东西10月10日消息,今日,据外媒Business Insider报道,谷歌正在 内部测试Gemini 4的一个新版本 ,代号为 Carbon ,有望进一步缩小其与竞争对手在编程能力上的差距。 目前,Carbon已接入谷歌内部编程平台Jetski。部分员工认为,该模型的编程体验 与Claude Opus 5.5近似 ,但有员工强调,模型实际需要进行更多测试,才能作出更准确的判断。 谷歌已于10月1日发布Gemini 4 Argon ,重点面向 软件工程、企业知识工作、网络安全防御等场景 ,目前该模型尚未面向公众推出。 Carbon可能是Argon训

2026中国计算机大会定了,12位院士演讲,腾讯阿里百度、小米京东都来了
智东西 作者 | 王涵 编辑 | 云鹏 智东西10月10日报道,今天,第二十三届中国计算机大会(CNCC2026)新闻发布会在京举行,智东西等媒体受邀参加。 据介绍,CNCC2026将于 10月21日至24日 在四川成都举办,主会场设于中国西部国际博览城和天府国际会议中心,大会主题为 “数聚驱动,智算未来” 。 本届大会共设 17场特邀报告、3场大会论坛、167个专题论坛及40余场专题活动 ,同期还将举办CCF计算机展览会。 其中,专题论坛演讲者有 789位 , 院士级演讲者有12位 ,来自腾讯、阿里、百度、小米、京东等企业专家达 92位 。 专题论坛围绕 11大主题 领域展开,包括:AI基础

好产品就是与时代和生活共振|2026 年度极客最爱好物启动
一件好产品,往往是在用过一段时间之后,才让人意识到它的好。出门时顺手带上,遇到事情时首先打开,或者因为有了它,愿意尝试一件过去觉得麻烦的事。这样的产品,值得被分享给更多人。 2026 年,我们把寻找好产品的目光,投向更丰富的形态。能协助完成任务的 AI 应用、戴在身上的智能设备,以及尝试在真实环境中干活的机器人,都进入了今年的选品视野。技术提供了新的可能,具体的产品体验,决定了人们愿不愿意把它们带进生活。 我们关注产品解决了什么问题,也在意使用它要付出多少学习和操作成本。一款创作工具,可以让想法更容易实现;一件有趣的小设备,也可以只负责让人开心。我们同样欢迎那些在设计、手感或某个小细节上做得出

记录生生不息的创新力量|2026 年度「InnoForce 50」启动
过去几年,科技行业最重要的变化之一,是创新的底层逻辑正在被重新改写。 到了 2026 年,AI 已经不只是技术变量,而成为影响产品形态和组织方式的关键变量。它开始进入办公室、工厂、汽车、机器人、医院等场景,也进入了许多过去并不处在科技叙事中心的行业。它改变软件,也反过来改变硬件;改变一个人的工作方式,也改变一家公司的组织方式。 但 AI 不是全部。真正值得被记录的,是当 AI 成为新变量之后,整个创新世界被重新点燃了。 有人从 AI 出发,做出了过去不存在的产品;有人把 AI 带进传统行业,去解决那些卡了十年、二十年的老问题;有人重新思考人与机器的关系,让机器不只是工具,而是执行者,甚至某种意