数码之家

 找回密码
 立即注册

QQ登录

只需一步,快速开始

搜索
查看: 28|回复: 0

[业界] 阿里发布Qwen-Audio-3.0-ASR-Flash语音识别大模型,让AI更好听懂专业词汇

[复制链接]
发表于 3 小时前 | 显示全部楼层 |阅读模式

爱科技、爱创意、爱折腾、爱极致,我们都是技术控

您需要 登录 才可以下载或查看,没有账号?立即注册

x
IT之家 7 月 31 日消息,阿里巴巴今日发布语音识别大模型



Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。
研究团队持续从医疗、IT 编程、股票、社会名人等领域里挖掘专业词汇,建成了覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。在最新的行业词汇内部评测中,新模型对各行业专业词的“听中率”都有明显提升,其中医疗场景更是突破了 95.36%。
目前,Qwen-Audio-ASR-Flash 系列已经在会议纪要整理、实时字幕、教育录播、智能客服等场景里得到验证,曾在 AI 评测平台 Artificial Analysis 上,以 1.7% 的错字率拿下全球第一。
Qwen-Audio-3.0-ASR—— 现已通过阿里云百炼平台开放调用,提供三个版本:
Qwen-Audio-3.0-ASR-Flash:语音识别,最长 5 分钟
Qwen-Audio-3.0-ASR-Filetrans:离线文件转写
Qwen-Audio-3.0-ASR-Streaming:实时语音识别





您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

APP|手机版|小黑屋|关于我们|联系我们|法律条款|数码之家-技术知识分享平台

闽公网安备35020502000485号

闽ICP备2021002735号-2

GMT+8, 2026-7-31 19:45 , Processed in 0.078000 second(s), 5 queries , Gzip On, Redis On.

Powered by Discuz!

© MyDigit.Net Since 2006

快速回复 返回顶部 返回列表