AikanAI
Retour au fil
Fil d’actualitésChineindustry

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

Source智东西(zhidx.com)14 hours ago · 10/10/2026
00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本

智东西

作者 | 杨京丽

编辑 | 李水青

智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。

以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。

这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。

换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。 强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。

这一发现来自论文《 基础模型可以借助训练数据中的线索进行推理 (Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。

论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已 先后在ICML和NeurIPS上发表研究成果 。

论文链接:

https://arxiv.org/abs/2610.06851

项目链接:

https://www.sophielwang.com/cues

开源地址:

https://github.com/sophicle/cues

一、回答开头只改两个token,基础模型准确率追平强化学习版本

论文将模型回答拆分为“开头token线索”和后续生成内容两部分。研究者通过预先固定回答开头,观察不同开头如何改变模型接下来的生成结果。

他们首先观察Olmo-3-7B在MATH-500上的回答。 正确答案中,约有50%的回答以“.\n\n”(句号加两个换行)开头,错误答案中这一比例只有14%。 句号和换行本身没有提供数学知识,却与正确率出现了明显关联。

研究者随后从模型可能生成的回答开头中寻找有效线索。他们先用搜索方法找出基础模型较可能生成的短开头,再让模型从每个开头继续回答,比较多次采样结果的一致性。

对Olmo-3-7B,最终选中的开头是“.\n\nOkay”;对Qwen3-14B,选中的是“ Alright,”。 研究者把这些文字预先填入模型回答,再让模型自行生成后续内容。

在MATH-500上,Olmo-3-7B基础模型自行生成回答开头时,其准确率约为 42% ;将回答开头固定为“.\n\nOkay”后,准确率升至约 78% ,高于其强化学习版本约 75% 的成绩。

Qwen3-14B使用“ Alright,”作为回答开头后,准确率则 从72%提高到87% ,与强化学习版本持平。相同开头还被用于GSM8K、AMC 23、AIME 2024等数学测试, 在多数测试中都能带来提升 。在代码生成测试HumanEval上,固定开头提高了Olmo-3-7B的成绩;Qwen3-14B的成绩则与不固定开头时相近。

论文中展示了一道具体题目的生成差异。题目较为简单,要求计算 834名学生占全校人数三分之二时,全校共有多少名学生 。

当模型以“.\nAnswer”开头时,它直接给出“1002”,答案错误;当模型以“.\n\nOkay”开头时,它先列出 “(2/3)×T=834”,计算出1251 ,随后又主动检查结果,确认计算没有问题。设置新开头后,模型给出了正确的答案,生成过程中,模型没有获得额外提示,也没有更换参数,仅修改了回答开头。

二、从14%升至65%,强化学习先改变模型的回答开头

如果基础模型在固定开头后已经能达到接近强化学习模型的成绩,强化学习究竟改变了什么?

研究者采用RL-Zero设置,让模型直接根据自己生成答案的对错获得奖励。比较强化学习前后的模型后,他们发现, 两者预测分布的最大差异集中在回答最开始的两个token 。

对Olmo-3-7B,强化学习将“.\n\nOkay”的生成概率 从0.14提高到0.65 ;对Qwen3-14B,“ Alright,”的生成概率 从0.04提高到0.58 。强化学习前后,模型的预测差异主要集中在回答最开始的两个token,之后差异明显减小。

研究者还把强化学习模型已经生成的回答开头交给基础模型,让基础模型从相同位置继续回答。Olmo-3-7B在这种条件下可以达到强化学习模型的准确率。

训练曲线显示,预先固定有效开头后, Olmo模型的成绩大约相当于标准强化学习训练100步后的水平,Qwen模型则相当于约50步后的水平。

这说明,在这组实验中, 强化学习的一部分作用可能是提高模型选择有效推理开头的概率 ,让它更容易进入原本已经存在的推理路径。

研究者还控制了回答长度。 部分开头会让模型写出更长的回答 ,但准确率仍低于不固定开头的结果;在相同token预算下,“.\n\nOkay”仍保持优势。因此,成绩提升不能只用回答变长来解释。

三、训练数据改写词语关联,“Chicken”也能诱导推理

“Okay”为什么有效?它可能符合人类开始思考时的表达习惯,但研究者希望进一步确认,效果是否来自训练数据中反复出现的词语关联。

他们 将Olmo模型中期训练数据里与推理轨迹共同出现的“Okay”替换为“Chicken” ,再从相同检查点继续训练。测试时,模型都被固定为以“.\n\nChicken”开头。

在原始基础模型中,固定“.\n\nChicken”后的MATH-500 准确率约为18% ,低于不固定开头时的42%。重新训练后,模型则会沿着推理文本的模式继续生成, 准确率升至77% ,接近“.\n\nOkay”开头的78%。

在使用10B-token中期训练数据的重训实验中,固定“.\n\nChicken”后,MATH-500准确率从2.4%升至37.2%;在使用100B-token数据的另一组实验中,准确率则从18.2%升至76.9%。两组实验的数据规模不同,但都说明, 重新建立“Chicken”与推理文本之间的训练关联后,这个词才具备了推理线索的作用 。

修改后的模型也没有忘记Chicken的日常含义。面对“A chicken is a”或“She roasted the chicken”这样的句子,它仍然可以生成与鸟类或食物有关的内容。

研究者还将训练数据中的 “step by step”替换成“duck duck goose” 。重新训练后, “Think duck duck goose”也能像“Think step by step”一样诱导模型推理 。

隐藏状态分析显示,不同开头会把模型带向不同类型的训练文本。“.\n\nOkay”更接近合成推理轨迹,“To”更接近解释型数学文本,“Answer”则更接近简短问答文档。研究者还发现, 线索越早出现在回答中,产生的影响越持久 ;等到第三至第六段才插入“Okay”,效果会明显下降。

四、修改回答开头,模型可能拒绝请求

此外,研究者还把同样的方法用于安全测试中,观察不同回答开头会如何影响模型拒绝或遵从请求。

在Olmo-3-7B中, 以“I’m sorry”开头的回答更容易拒绝请求 ,但也会增加对无害请求的误拒绝; “Okay,”会减少拒绝 ,并增加模型对危险请求给出有害内容的概率。

数学实验中有效的“.\n\nOkay”则呈现出另一种效果:模型会更多拒绝危险请求,同时减少对正常请求的误拒绝,表现出更有选择性的拒绝行为。

论文还发现, 仅仅改变空格、标点和换行方式,就可能带来不同结果 。“Okay,”和“.\n\nOkay”看起来很接近,但前者可能成为更容易遵从危险请求的开头,后者则更接近先分析、再决定是否拒绝的回答模式。

这说明,回答开头对模型行为的影响并不局限于数学推理,也涉及拒答、安全等问题。

结语:模型能力和稳定发挥之间,还隔着一个“开头”

通过这篇论文可以发现:模型答错题,有时不代表它完全不会做,也可能是没有进入正确的思路。对Olmo-3-7B来说,只是在回答开头加上“.\n\nOkay”,准确率就从约42%提高到了78%。

“Chicken”的实验则说明,词语能起什么作用,和它在训练数据中经常跟什么内容一起出现有关。经过重新训练后,“Chicken”也能引导模型一步步解题。模型记住的可能不只是词语本身,还包括这个词通常会带来什么样的回答。因此,在实验条件下,预先固定有效的回答开头,都可能帮助模型进入更适合解题的状态。

不过,需要注意的是,实验测试的模型主要为Olmo-3-7B和Qwen3-14B,无法确定在其他模型上是否能产生类似的效果。这种方法是否有效,还要看具体模型和任务。这一方法虽然在一定程度上能够提高准确率,但想让模型面对不同问题和不同表达时都能稳定回答,仍然需要高质量的训练数据和充分的模型训练。

Les actualités sont collectées automatiquement depuis des flux publics robotique & IA.

Articles liés

InternationalindustryTraduction automatique

Pourquoi la dextérité est le véritable goulot d’étranglement de l’IA physique

Le prochain défi majeur en matière de dextérité robotique consiste à rendre l’ensemble du système suffisamment fiable pour transformer ses capacités en travail utile. L'article Pourquoi la dextérité est le véritable goulot d'étranglement de l'IA physique apparaît en premier sur The Robot Report.

SourceRobotics Business Review8 hours ago
Chineindustry

Agentic开发时代到来!鸿蒙PC三大原生开发工具公测,补齐国产操作系统生态关键短板

智东西 作者 | 程茜 编辑 | 漠影 当一台鸿蒙PC,既能跑鸿蒙应用,又能原生开发鸿蒙应用,会发生什么? 智东西10月10日报道,10月8日,可视化一站式IDE工具DevEco Studio、一站式鸿蒙应用AI开发工具DevEco Code与AI开发能力套件DevEco CLI,同步开启鸿蒙PC版公测。 三者分工明确:DevEco Studio主打集成开发、多端调试,承担基础IDE核心能力;DevEco Code提供端到端一站式Agentic开发体验;DevEco CLI对外输出鸿蒙开发能力,可无缝对接外部各类Agent工作流,让 AI 辅助开发融入鸿蒙 PC 原生环境。 DevEco三件套

Source智东西9 hours ago
Chineindustry

编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光

智东西 编译 | 杨京丽 编辑 | 李水青 智东西10月10日消息,今日,据外媒Business Insider报道,谷歌正在 内部测试Gemini 4的一个新版本 ,代号为 Carbon ,有望进一步缩小其与竞争对手在编程能力上的差距。 目前,Carbon已接入谷歌内部编程平台Jetski。部分员工认为,该模型的编程体验 与Claude Opus 5.5近似 ,但有员工强调,模型实际需要进行更多测试,才能作出更准确的判断。 谷歌已于10月1日发布Gemini 4 Argon ,重点面向 软件工程、企业知识工作、网络安全防御等场景 ,目前该模型尚未面向公众推出。 Carbon可能是Argon训

Source智东西9 hours ago
Chineindustry

2026中国计算机大会定了,12位院士演讲,腾讯阿里百度、小米京东都来了

智东西 作者 | 王涵 编辑 | 云鹏 智东西10月10日报道,今天,第二十三届中国计算机大会(CNCC2026)新闻发布会在京举行,智东西等媒体受邀参加。 据介绍,CNCC2026将于 10月21日至24日 在四川成都举办,主会场设于中国西部国际博览城和天府国际会议中心,大会主题为 “数聚驱动,智算未来” 。 本届大会共设 17场特邀报告、3场大会论坛、167个专题论坛及40余场专题活动 ,同期还将举办CCF计算机展览会。 其中,专题论坛演讲者有 789位 , 院士级演讲者有12位 ,来自腾讯、阿里、百度、小米、京东等企业专家达 92位 。 专题论坛围绕 11大主题 领域展开,包括:AI基础

Source智东西13 hours ago
Chineindustry

好产品就是与时代和生活共振|2026 年度极客最爱好物启动

一件好产品,往往是在用过一段时间之后,才让人意识到它的好。出门时顺手带上,遇到事情时首先打开,或者因为有了它,愿意尝试一件过去觉得麻烦的事。这样的产品,值得被分享给更多人。 2026 年,我们把寻找好产品的目光,投向更丰富的形态。能协助完成任务的 AI 应用、戴在身上的智能设备,以及尝试在真实环境中干活的机器人,都进入了今年的选品视野。技术提供了新的可能,具体的产品体验,决定了人们愿不愿意把它们带进生活。 我们关注产品解决了什么问题,也在意使用它要付出多少学习和操作成本。一款创作工具,可以让想法更容易实现;一件有趣的小设备,也可以只负责让人开心。我们同样欢迎那些在设计、手感或某个小细节上做得出

Source极客公园14 hours ago
Chineindustry

记录生生不息的创新力量|2026 年度「InnoForce 50」启动

过去几年,科技行业最重要的变化之一,是创新的底层逻辑正在被重新改写。 到了 2026 年,AI 已经不只是技术变量,而成为影响产品形态和组织方式的关键变量。它开始进入办公室、工厂、汽车、机器人、医院等场景,也进入了许多过去并不处在科技叙事中心的行业。它改变软件,也反过来改变硬件;改变一个人的工作方式,也改变一家公司的组织方式。 但 AI 不是全部。真正值得被记录的,是当 AI 成为新变量之后,整个创新世界被重新点燃了。 有人从 AI 出发,做出了过去不存在的产品;有人把 AI 带进传统行业,去解决那些卡了十年、二十年的老问题;有人重新思考人与机器的关系,让机器不只是工具,而是执行者,甚至某种意

Source极客公园15 hours ago