核心能力
流式识别
边说边出字,低延迟增量返回,支撑实时交互场景
非流式转写
长音频一次性转写,追求更高准确率与完整标点
多说话人分离
自动区分「谁在什么时候说话」,输出带角色标注的文稿
多引擎调度
多家识别引擎一个入口,效果与成本可权衡
适用场景
- 会议纪要、访谈录音的自动整理与角色还原
- 语音客服、实时字幕等低延迟转写
- 音视频内容的字幕生成与检索
接入方式
REST 整转与 WebSocket 流式并存,按延迟与准确率需求选择。
边说边出字,低延迟增量返回,支撑实时交互场景
长音频一次性转写,追求更高准确率与完整标点
自动区分「谁在什么时候说话」,输出带角色标注的文稿
多家识别引擎一个入口,效果与成本可权衡
REST 整转与 WebSocket 流式并存,按延迟与准确率需求选择。