实时转写更快了
实时语音链路切换到流式解码器,录制时文字出现得更早,长会话中的节奏也更稳定。
新增
实时转写改用流式解码器
实时语音识别现在运行在流式解码器上,缩短了从说出到文字出现在转写中的延迟。
分句与最终文本分离
实时通路负责判断句子在哪里断开,更高质量的通路负责产出最终保留的文字。拆开之后,两者可以各自按其真正的职责来调优。
改进
- 会话报告就绪之前会先预热解码器,录音的第一句话不再是最慢的一句。
- 实时处理重新回到所部署 GPU 的预算之内,消除了长会话中逐渐累积的漂移。
- 语音活动检测已更新以匹配所部署的模型,语音起止的判定更准确。
修复
- 修复了客户端与所部署语音活动检测模型的接口不匹配问题。
- 修复了长录音中转写可能越落越后的节奏问题。