登录

语音


分类

转写

二是链路割裂——语音转写、声纹识别、语音翻译等能力被拆成独立模块串联运行,模块之间存在断点,容易累积错误,体验上也会出现延迟、卡顿。
文章

在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。
文章

识别

与讯飞星火大模型的“1+N”体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或系统。
文章

在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别评测中,其得分高于Gemini-3.1Pro,并在Fleurs中文测试集中取得SOTA。
文章

在多项任务中,与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比,在多语言、多方言语音识别的平均效果上表现出优势;
文章

翻译