口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

智东西
作者 | 杨京丽
编辑 | 李水青
智东西9月24日报道,昨日,科大讯飞推出最新 语音识别大模型Spark-ASR-2.0 。该模型基于 讯飞语音基座大模型Spark-Audio-1.0-Preview 构建,重点提升 通用识别、复杂声学场景识别、上下文识别和文本流畅规范性 。
值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均 基于全国产算力展开训练 。讯飞正在以多年积累的智能语音技术和国产算力平台大模型训练经验为基础,持续推进语音基座模型、专用模型等技术迭代。
尽管大多数语音识别模型在日常使用中基本能够准确转写,但在 嘈杂环境 中输入、 中英文混合 输入,或者 对专业会议进行转录 时,仍可能出现错字、漏字; 语气词、重复和临时改口 ,也常让转写结果需要二次整理。目前大部分语音识别模型的目标还停留在单纯的精准识别转写上。
为了验证Spark-ASR-2.0能否解决上述问题,智东西围绕 通用识别、复杂声学场景识别、上下文识别、文本流畅规范性 四个方向展开实测。
实测中,Spark-ASR-2.0整体识别表现较为稳定,能通过 上下文修正部分歧义表达,减少口头语和重复内容 ,让语音转写结果更接近一段 可以直接使用 的文本。
Spark-ASR-2.0已陆续上线 讯飞输入法 ,并且通过讯飞开放平台提供 API服务 ,也开放了体验链接。后续还将逐步应用到 讯飞AI眼镜、智能办公本和讯飞听见 等产品上。
一、方言、芯片术语轻松识别,悄悄话也能听清
首先来看通用识别能力,我们用河南话对Spark-ASR-2.0进行了简单测试。
几乎在说完话的瞬间,模型就正确完成了语音识别。看来方言对于Spark-ASR-2.0来说,难度不大。据了解,Spark-ASR-2.0现已支持全国 202种方言免切换识别 。
接下来,为了测试模型在 中英文混合场景 下,能否听得准,专业术语能否写得对,我们用一段芯片公司的业务介绍继续测试。
这段话包含RISC-V、TPU、VISA等多个英文缩写和芯片专业术语,句子较长,且中英文表达交织。
Spark-ASR-2.0完整识别整段内容,专业词汇也没有出错。对于科技媒体、技术会议等场景来说,这类专业术语的准确转写,能够 减少后续人工校对成本 。
之后,我们又测试了模型在 复杂声学场景 的表现,这也是代表实际应用场景的关键维度。
我们先在 地铁噪音场景 下进行实测。
在背景噪声较为明显的情况下,模型能够区分环境声音和说话声音,识别出“一号线”、“东单”等关键信息,完整进行转写。
我们还测试了Spark-ASR-2.0的 悄悄话识别能力 。
在刻意压低音量、使用气声说话的情况下,Spark-ASR-2.0仍然可以准确识别出完整内容。对于办公室等不方便大声说话的场景,低声说话,模型也能做到精确转写。
二、上下文纠错、口语规范成文,转写实现“零返工”
在不同场景下,准确识别语音只是第一步。相比逐字记录,用户更希望语音识别模型能够 根据上下文调整 ,输出流畅、规范的文本。
于是,我们测试了模型的 上下文识别能力 。
模型根据后文中“山峰的峰”,判断出“张三峰”的正确写法,后面“台风的风”也没有出现同音字错误的情况。
这个案例中,模型同样能够结合后文的解释理解语义,将易混淆的“灵”和“苓”调整为正确文字。
在 文本流畅性 方面,我们模拟平常发信息时会出现的停顿、重复、改口等情况,观察模型的转写结果是否可以直接使用。
面对停顿、磕绊、改口,模型能够 删去冗余内容 ,将会议时间修正为“8点半”,后面的邮箱也能够按照正确格式输出。
下面这个例子,我们进一步提高难度,加入了日期、取件码、快递单号等信息,看看模型能否规范输出。
测试结果中,取件码、快递单号和日期均准确识别,并且输出形式规整,没有因为连续数字、字母和符号混合,而出现遗漏或中断, 转写结果可以直接使用 。
三、先快速识别、再重点纠错,推理成本较上代仅增10%
Spark-ASR-2.0的升级,建立在讯飞语音大模型持续演进的基础上。
9月16日,科大讯飞推出基于全国产算力训练的 语音基座大模型Spark-Audio-1.0-Preview ,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。
Spark-ASR-2.0是基于这一语音底座打造的语音识别大模型,同样 基于全国产算力训练 ,进一步聚焦语音识别的准确性、实时性、语言理解和文本规范。
在去年科大讯飞全球1024开发者节上曾首发了非自回归语音识别大模型Spark-ASR-1.0,实现了推理效率的大幅提升,能够并行、一次性输出整个文本序列, 效果相对提升16%,推理成本下降84% 。
从官方测试结果来看,Spark-ASR-2.0在语音识别核心场景上的效果较Spark-ASR-1.0进步明显。 绝大多数场景的WER(词错误率)低于业界最优水平 ,在方言、高噪和小音量场景下表现最为突出。
不过,要同时兼顾识别效果、响应速度和推理成本并不容易。快速识别往往难以充分理解复杂语境,而强化语言理解又可能带来更高的时延和计算成本。
为解决这一问题,Spark-ASR-2.0延续了Spark-ASR-1.0 非自回归识别能力 ,同时 融合LLM增强的自回归识别能力 。
传统自回归模型需要按照文字顺序逐步生成,语言理解能力较强,但处理速度和计算成本相对较高;非自回归模型则可以并行完成整段语音的初步转写,响应更快,但面对复杂语境和易混淆表达时,修正能力有限。
Spark-ASR-2.0结合两种架构,先由 非自回归模块 快速生成整段语音的识别结果,再通过 投机解码 判断其中是否存在需要结合上下文进一步理解的内容,以及需要从哪里开始修正。
这种方式避免了对全文重新解码,在 控制推理时延和计算成本 的同时,提升了复杂语境、长尾表达和口语化内容的识别能力, 整体推理成本较Spark-ASR-1.0仅增加10% 。
此外,针对中英文混合场景下数据匮乏的问题,模型通过补充英文专有词与热词,形成中英文混合文本数据,并结合语音特征和发音相似性进行联合训练, 提升了对专业术语和不规范发音的识别能力 。
在上下文识别方面,Spark-ASR-2.0引入 动态上下文注入机制 ,能够结合 当前语音、个性化热词和用户历史修改 ,对人名、专业术语及易混淆表达进行综合判断,并从 万级热词库 中筛选相关候选词,在提升识别准确性的同时,减少无关信息干扰,基本不增加响应时延。
结语:基于长期技术积累,语音识别走向“流畅成文”
对语音识别而言,能把声音转换成文字早已不是终点,复杂环境下能否稳定转写、口语能否自动整理成文,正在成为新的竞争焦点。
科大讯飞从实际需求出发,关注降噪、专业术语、口头语、文本规范性等细节问题,把语音识别进一步推向“流畅成文”,让语音识别变成能够 直接提升效率的生产力工具 。
这也是科大讯飞长期深耕智能语音技术的一次延续。尤其在语音识别领域,科大讯飞曾 连续六届收获语音识别国际权威赛事CHiME冠军 ,面向“鸡尾酒会”问题不断挑战识别难题。
这也是科大讯飞长期深耕智能语音技术的一次延续。尤其在语音识别领域,科大讯飞曾 连续六届收获语音识别国际权威赛事CHiME冠军 ,面向“鸡尾酒会”问题不断挑战识别难题。
2024年,科大讯飞作为第一完成单位的“多语种智能语音关键技术及产业化”项目获得 国家科学技术进步奖一等奖 。值得一提的是,讯飞过去积累的核心语音技术能力,始终围绕真实环境中的识别难题展开。
在大模型时代,讯飞将深厚的技术积淀与AI融合,持续探索语音大模型的更多可能。从近期推出 语音基座模型 ,到昨日发布 语音识别大模型 ,再到后续规划中的 系列语音相关大模型 ,这一系列动作不仅展现了科大讯飞不断突破语音技术领域天花板的决心,也体现了持续推动技术应用落地、赋能产品业务的实践路径。
资讯由采集器定时从公开机器人 / AI 信息源自动聚合。
相关内容

除了更贵的订阅和砍半的额度,OpenAI 想做的还是「微信」
模型越来越便宜,付费给的用量却砍了半 作者|Alan 北京时间 9 月 30 日凌晨,OpenAI 开完了它口中「迄今规模最大的一届」开发者大会。官方汇总页上一共列了 25 项发布,从新模型、新 API,一路排到给企业买软件用的应用市场。 现场最安静的一刻,出现在 Sam Altman 讲到 ChatGPT Pro 会员调整的时候。台下没有一个人鼓掌。 调整本身不复杂:每月 200 美元的 Pro 200 价格不变,新订阅的用量缩水;另外新增一档 Pro 500,每月 500 美元,用量是 Plus 的 25 倍,外加一个个人套餐里只有它能用的提速档 Astra Ultrafast。 那一阵沉

刚刚,iQOO掏出年度旗舰,自研电竞芯片性能提升15%,首款电竞平板也来了
智东西 作者 | 陈骏达 编辑 | 心缘 智东西9月29日报道,刚刚,vivo旗下iQOO品牌发布了年度旗舰手机iQOO 16,这台手机搭载了第六代骁龙8超级至尊版,全球首发了由iQOO和三星显示联合研发的2K 165Hz三星珠峰屏,并基于iQOO搭建的“3+2游戏技术版图”,提升了手机在视效、操控、直播和跨端游戏等维度的体验。 同时,iQOO还发布了其首款电竞平板iQOO Pad Ultra,这款产品同样采用第六代骁龙8超级至尊版,并搭配iQOO自研电竞芯片Q4和全新一代Monster超核引擎,还通过五重风冷散热系统、新一代超感触控引擎和自研Q-flex操控技术提升游戏体验。 先来看iQOO

刚刚,DeepSeek Harness桌面端上线,梁文锋开送Token了
智东西 作者 | 江宇 编辑 | 漠影 智东西9月29日报道,今日, DeepSeek正式推出DeepSeek Harness v0.2预览版 ,并提供开箱即用的macOS和Windows 桌面端 安装包。 ▲DeepSeek Harness v0.2预览版界面 用户前往DeepSeek Harness官网下载安装后,按照引导即可直接使用,无需再自行配置开发环境。 这是DeepSeek Harness自8月13日晚推出开发者预览版v0.1并同步开源后的又一次重要更新。 此次v0.2进一步补齐了 桌面端产品体验 ,不仅 预置日常办公和开发中的常用功能 ,还新增 插件安装与管理页面、自动化任务 等

AMD 82 亿美元收购 World Labs,买的不只是世界模型
9 月 3 日,英伟达宣布以约 130 亿美元收购 Hugging Face。25 天后,AMD 宣布以约 82 亿美元收购李飞飞创办的 World Labs。 两笔交易放在一起看,更觉得有意思。CNBC 最新的报道提到,Hugging Face 在被英伟达拿下之前,AMD 和 Salesforce 都曾表达过收购兴趣。 没抢到 AI 世界里最大的模型「集散地」,AMD 转身买下了一支造模型的顶级团队。 根据 AMD 的公告,这是一笔全股票交易 ,预计在 2026 年底前完成交割,仍需通过监管审批。交割之后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰汇报。 这也是 A

让Token像土豆一样便宜,要闯哪四关?
进入2026年下半年,全球算力涨价潮持续发酵。 “让全世界更多的人,像享受土豆一样,享受Token。” 9月19日,央视《对话》走进远景乌兰察布星河基地,远景科技集团创始人张雷用这个比方,提出了一个看似简单的问题: AI怎样才能更普惠? 这句“AI土豆论”很快在算力圈引发讨论,背后是全行业共同的成本焦虑: AI算力的门槛,实在太高了。 就在节目播出三天后,小米发布MiMo-V2.6,并公开了全程直播的“炼丹”账本,把这份昂贵具象化:MiMo-V2.6的Pro与Flash两个版本,仅强化学习后训练阶段就跑了不到6天,合计烧掉了 347万美元 , 约合人民币2344万元 。 这还只是后训练环节。据
Anthropic 招股书里,最耐人寻味的 7 个细节
作者|Techno 之王 编辑|靖宇 当地时间 9 月 28 日,外媒披露了一份 Anthropic 的 IPO 招股书。 先要说清楚这份文件的性质。它并不是 Anthropic 主动公开的版本。今年 6 月,Anthropic 以公益公司身份向美国证交会秘密递交了 S-1 注册声明草案,为普通股首次公开发行做准备。按照规则,公司要在向机构投资者路演前至少 15 天公开递交修订版 S-1,完整财务数据到那时才会被外界看到。路透此次看到的是一份尚未公开的版本, Anthropic 对此拒绝置评 。 这意味着其中的数字仍可能随证交会的审阅意见调整,不少细节也只能通过路透的转述窥见一角。 但如果这份