智能座舱
科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型
📋总体概括
9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。该模型支持文本和语音双模态输入、文本输出,可完成语音转写、多语言翻译、多方言识别、说话人识别、情感分析及复杂音频问答等任务,覆盖99种语言和202种方言,实现智能语音从「听清」到「听懂」的能力跃升。目前模型已开放体验,API后续将上线讯飞开放平台,全国产算力训练是其核心卖点。
⚡关键信息
- ▸9月16日科大讯飞发布Spark-Audio-1.0-Preview语音基座大模型,基于全国产化算力训练
- ▸模型支持文本和语音双模态输入、文本输出,覆盖99种语言及202种方言识别
- ▸可支持语音转写、多语言翻译、环境音识别、说话人识别、情感分析及复杂音频问答等任务
- ▸官方称其实现智能语音从「听清」到「听懂」的跃升,目前开放体验,API将上线讯飞开放平台
🔥犀利点评
全行业还在为算力卡脖子焦虑时,讯飞把「全国产算力训练」做成发布会的第一卖点,这既是政治正确也是实打实的护城河。202种方言识别看似炫技,实则是大厂不愿弯腰捡的脏活,恰是讯飞在B端和政企市场的立足点。但语音基座赛道上字节、阿里都在压境,Preview阶段没有公开对标成绩单,「听懂」到底懂到什么程度,还得等API上线后见真章。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 36氪快讯 阅读全文 →