一个月扫出近5000漏洞,Anthropic发布OSS Scanner,最强模型免费做“安全卫士”

智东西
编译 | 张情
编辑 | 云鹏
智东西10月9日消息,AI找漏洞,正在从“帮倒忙”变成“真帮手”。
Anthropic最新推出OSS Scanner,用自家最强模型免费给开源项目做定期安全扫描,不经过人工审核,报告直接发给维护者。从抽检结果看,严重和高危漏洞中,88%达到可以对外报告的标准。但另一方面,过去六个月扫出的2.9万个候选漏洞中,人工只验证了6000个,大量未验证报告正被批量发给维护者。
开源安全迎来的是“快车道”,还是“噪音场”?这场实验才刚刚开始。
一、 Anthropic最强模型加持,速度更快,但不经人工审核
据Anthropic官方推特账号消息,其发布了一款面向开源生态的自愿加入型漏洞扫描器OSS Scanner——该工具受OSS-Fuzz(其是谷歌于2016年推出的免费开源软件漏洞扫描服务)对开源生态积极影响的启发,并基于Anthropic在Project Glasswing期间使用Claude寻找漏洞的经验(Project Glasswing是Anthropic牵头、联合科技巨头用AI提前给关键软件“体检”的防御计划),用最强语言模型在开源代码中寻找漏洞,为开源项目免费提供安全审计。
加入OSS Scanner的开源软件,将免费获得由Anthropic最强模型进行的全面、定期安全扫描。
这个自愿加入型扫描器的输出,完全由模型生成,不经过人工审查或分类。这能实现更快、更频繁的扫描,但也意味着报告可能不正确或无效。这些报告由Anthropic最强模型(含Claude Mythos)生成,目的是让开源项目获得最大的防御优势。
二、6个月发现近3万漏洞,人工成了最大瓶颈
大语言模型发现漏洞的能力正在快速提升。在学术漏洞发现基准CyberGym上(CyberGym是一个大规模网络安全基准测试框架,专门评估AI智能体在真实软件中挖掘漏洞的实战能力),大语言模型在去年初,只能发现不到20%的漏洞,今年已能发现超过85%。这一进步,也直接改变了开源维护者收到的报告:过去大多是大语言模型生成的垃圾报告,如今则变成了高质量的漏洞报告。
过去六个月,Anthropic用最新模型扫描了全球一些重要的软件项目,发现超过2.9万个候选漏洞,但只能人工审查和分类约6000个。6000个已经很多,人工验证能力仍是瓶颈。
Anthropic正在扩大漏洞披露规模。与此同时,越来越多的维护者在收到首批报告后,直接要求批量提交所有未验证报告和拟议补丁。截至目前,已有维护者要求接收Anthropic掌握的全部内容——即使尚未验证,Anthropic已直接发送近5000份报告。
如今,漏洞利用程序几分钟就能开发出来。项目只有更快发现并修复漏洞,才能更好地保护软件,抵御那些同样在竞相寻找并利用这些弱点的攻击者。Anthropic会继续通过现有的协同漏洞披露(CVD)流程,人工披露经过验证的漏洞报告,尤其是对那些无力自行分类报告的项目。但现在也为希望尽快收到漏洞报告的项目,提供了一条可选的快速通道。
三、实测效果积极:漏洞有效率高,甚至比人工报告还好
过去几周,Anthropic与数十个开源项目一起验证了这条流水线。初步披露包含数百份漏洞报告,其中多个漏洞可串联成未授权的远程代码执行利用,影响相关项目。每份报告都包含可独立运行的复现脚本、漏洞说明,以及可用的候选补丁。目前该服务已开放给更多开源项目。
在测试OSS Scanner早期版本和原始模型输出时,Anthropic收到了一些反馈:
PostgreSQL是全球主流的开源数据库之一,很多网站和系统的后台数据都存在里面。PostgreSQL的Noah Misch表示:“OSS Scanner的发现中,揭露PostgreSQL缺陷的比例异常高。有几份报告附带的修复几乎可以直接使用,快速通道让我们在最新问题进入正式发布版之前就解决了它们。”
OpenSSL Corporation是OpenSSL加密库的“商业运营方”,靠企业支持合同赚钱,再拿钱养开源库的开发。OpenSSL Corporation的Anton Arapov表示:“大约18个月前、Project Glasswing之前的早期AI报告糟糕透顶。我们从Anthropic收到的报告,包括原始模型输出,已经和人工报告一样好,有时甚至更好。尤其当报告附带真实漏洞利用时,工程师基本就能搞定了,因为可以立刻验证。”
wolfSSL是一家做嵌入式设备加密通信安全库的美国公司。wolfSSL的Todd Ouska表示:“我们认为这些报告的有效信号很高:收到的74份报告中,除两份外都有效,其中5份成为‘公共漏洞和暴露’(CVE)。由于附带了补丁,这些报告可以直接进入我们现有的验证和修复流程。我们希望能收到更多。”
HotCRP是一个学术会议论文提交和评审管理系统,于2006年开发,广泛用于计算机学术会议。HotCRP的Eddie Kohler表示:“这些漏洞报告全面、清晰,对HotCRP复杂的权限模型有深入的理解,漏洞优先级也排得很好。”
为验证OSS Scanner的早期版本,Anthropic请审查其“协同漏洞披露”(CVD)发现结果的专业渗透测试人员,检查扫描器在48个项目中找出的97个严重及高危漏洞。其中85个(88%)达到CVD流程的标准。在剩下的12个中,有11个是真实问题,但属于已知问题或扫描中的其他发现的重复;只有1个是无效的,即“误报”。
此后,Anthropic已将大量发现发送给维护者。维护者很少反馈某个严重或高危发现无效,这与Anthropic此前的开源工作情况一致。不过,也有维护者反映:部分发现的严重性评级可能偏高,或者扫描器误解了项目的威胁模型。Anthropic则表示:无法保证扫描器完全准确,但会根据维护者的反馈和模型的进步,持续改进系统。
四、向GitHub提交,Anthropic审核,符合者获 6 个月 Claude Max 订阅
无论OSS Scanner是否适合,Anthropic新推出的网络安全验证计划(Cyber Verification Program),都能为符合条件的安全专业人员提供高级网络能力,并降低拦截分类器带来的限制。
符合条件项目的核心维护者,可以按照标准项目模板,向GitHub仓库提交PR来报名(GitHub是全球最大的代码托管和协作平台,开源项目基本都在上面,提交PR就是向项目方提交代码修改申请)。而项目是否符合条件,则参照与OSS-Fuzz类似的标准:简言之,项目需对“基础设施和用户安全有关键影响”,Anthropic将逐案决定。
此外,Claude for OSS是 Anthropic 面向开源维护者的支持计划,符合条件者可免费获得 6 个月的 Claude Max 20x 订阅,用来修复漏洞、改进项目。
结语:AI扫漏洞,免费但“生猛”
OSS Scanner的推出,体现出AI找漏洞从实验走向规模化服务。它用最强模型、零人工审核、免费开放的方式,试图解决开源安全长期面临的人力瓶颈。88%的抽检达标率和维护者的积极反馈说明,这条路走得通。但2.9万个候选漏洞只验证了6000个,大量未验证报告直接流向维护者,也埋下了误报和噪音的隐患。
Anthropic选择把“快”放在“准”前面,让开源项目自己决定是否接入这条快速通道。对维护者来说,这既是一份免费的安全红利,也是一场需要自行判断的信息洪流。
来源:Anthropic推特账号
Les actualités sont collectées automatiquement depuis des flux publics robotique & IA.
Articles liés

Pourquoi la dextérité est le véritable goulot d’étranglement de l’IA physique
Le prochain défi majeur en matière de dextérité robotique consiste à rendre l’ensemble du système suffisamment fiable pour transformer ses capacités en travail utile. L'article Pourquoi la dextérité est le véritable goulot d'étranglement de l'IA physique apparaît en premier sur The Robot Report.

Agentic开发时代到来!鸿蒙PC三大原生开发工具公测,补齐国产操作系统生态关键短板
智东西 作者 | 程茜 编辑 | 漠影 当一台鸿蒙PC,既能跑鸿蒙应用,又能原生开发鸿蒙应用,会发生什么? 智东西10月10日报道,10月8日,可视化一站式IDE工具DevEco Studio、一站式鸿蒙应用AI开发工具DevEco Code与AI开发能力套件DevEco CLI,同步开启鸿蒙PC版公测。 三者分工明确:DevEco Studio主打集成开发、多端调试,承担基础IDE核心能力;DevEco Code提供端到端一站式Agentic开发体验;DevEco CLI对外输出鸿蒙开发能力,可无缝对接外部各类Agent工作流,让 AI 辅助开发融入鸿蒙 PC 原生环境。 DevEco三件套

编程体验接近Opus 5.5?谷歌Gemini 4新版本曝光
智东西 编译 | 杨京丽 编辑 | 李水青 智东西10月10日消息,今日,据外媒Business Insider报道,谷歌正在 内部测试Gemini 4的一个新版本 ,代号为 Carbon ,有望进一步缩小其与竞争对手在编程能力上的差距。 目前,Carbon已接入谷歌内部编程平台Jetski。部分员工认为,该模型的编程体验 与Claude Opus 5.5近似 ,但有员工强调,模型实际需要进行更多测试,才能作出更准确的判断。 谷歌已于10月1日发布Gemini 4 Argon ,重点面向 软件工程、企业知识工作、网络安全防御等场景 ,目前该模型尚未面向公众推出。 Carbon可能是Argon训

2026中国计算机大会定了,12位院士演讲,腾讯阿里百度、小米京东都来了
智东西 作者 | 王涵 编辑 | 云鹏 智东西10月10日报道,今天,第二十三届中国计算机大会(CNCC2026)新闻发布会在京举行,智东西等媒体受邀参加。 据介绍,CNCC2026将于 10月21日至24日 在四川成都举办,主会场设于中国西部国际博览城和天府国际会议中心,大会主题为 “数聚驱动,智算未来” 。 本届大会共设 17场特邀报告、3场大会论坛、167个专题论坛及40余场专题活动 ,同期还将举办CCF计算机展览会。 其中,专题论坛演讲者有 789位 , 院士级演讲者有12位 ,来自腾讯、阿里、百度、小米、京东等企业专家达 92位 。 专题论坛围绕 11大主题 领域展开,包括:AI基础

00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本
智东西 作者 | 杨京丽 编辑 | 李水青 智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。 以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。 这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。 换句话说,基础模型答错题,有时不一定是完全不会做

好产品就是与时代和生活共振|2026 年度极客最爱好物启动
一件好产品,往往是在用过一段时间之后,才让人意识到它的好。出门时顺手带上,遇到事情时首先打开,或者因为有了它,愿意尝试一件过去觉得麻烦的事。这样的产品,值得被分享给更多人。 2026 年,我们把寻找好产品的目光,投向更丰富的形态。能协助完成任务的 AI 应用、戴在身上的智能设备,以及尝试在真实环境中干活的机器人,都进入了今年的选品视野。技术提供了新的可能,具体的产品体验,决定了人们愿不愿意把它们带进生活。 我们关注产品解决了什么问题,也在意使用它要付出多少学习和操作成本。一款创作工具,可以让想法更容易实现;一件有趣的小设备,也可以只负责让人开心。我们同样欢迎那些在设计、手感或某个小细节上做得出