EDITORIAL VIEW

19种语言一次调用,AssemblyAI新模型登顶榜首还打五折

从事实、趋势与实际场景出发,提炼值得关注的信息,为读者提供更清晰的阅读路径。

READ
DEEPER
ARTICLE / 2026

FEATURED REPORT

19种语言一次调用,AssemblyAI新模型登顶榜首还打五折

19种语言一次调用,AssemblyAI新模型登顶榜首还打五折

乐盈为你整理相关体育消息:

一个同步调用,19种语言的语音转文字全部搞定。

AssemblyAI的Universal-3.

5 Pro已经上线OpenRouter,而且到 9月29日 之前,价格直接砍半。

这不是一次常规的模型更新。

语音转文字这个赛道,长期被"多语言支持"和"识别精度"两个指标来回拉扯——支持的语言越多,单语种的准确率往往越难看。

Universal-3.

about image

5 Pro这次把两个数字同时摆上了台面: 19种语言 ,以及独立语音转文字基准测试中的 准确率第一 。

一次调用,两分钟音频 使用方式上,这个模型走的是极简路线。

你只需要发送一段最长 两分钟 的音频片段,就能拿回完整转录结果。

返回的内容不只是文字,还包括 词级时间戳 和 置信度分数 ——前者让你知道每个词在音频里的精确位置,后者告诉你模型对每个词的把握有多大。

对于做字幕、做会议记录、做语音分析的开发者来说,这两个字段的价值可能比转录文本本身还高。

词级时间戳意味着可以直接生成逐词高亮的效果,置信度分数则可以用来标记那些需要人工复核的片段。

用关键词把模型"掰"向你的领域 通用语音模型最头疼的问题,是遇到专业术语就翻车。

医学术语、法律名词、特定行业的黑话,模型没见过就容易听错。

Universal-3.

5 Pro给出的解法是:允许你提供 关键术语 和 上下文提示 ,把转录过程往你的领域方向引导。

这个设计思路很务实。

与其指望模型自己学会所有垂直领域的词汇,不如让使用者在调用时把领域知识喂进去。

对开发者来说,这意味着不用微调、不用额外训练,一次API调用就能拿到贴合业务场景的转录结果。

五折窗口期 上线OpenRouter的同时,AssemblyAI给了一个明确的时间节点: 9月29日 之前,价格五折。

这个窗口期不长,从消息发布到截止只有一周左右。

对于正在选型语音转文字方案的团队来说,这刚好是一个低成本试错的窗口。

19种语言、单次同步调用、词级时间戳、置信度分数、领域引导——这些能力打包在一起,五折价格试一周,够不够判断它能不能进你的技术栈,答案应该不难得出。

语音转文字这个方向,过去几年一直被认为是"已经解决"的问题。

但真正做过产品的人知道,多语言场景下的准确率波动、专业术语的识别率、时间戳的精度,每一个都是坑。

Universal-3.

5 Pro把准确率第一和19种语言放在同一个模型里,至少说明一件事:这个赛道还有人愿意往深水区走。

特别

乐盈将继续整理相关资讯。

YOU MAY ALSO LIKE

推荐阅读