语音
描述
OpenAI在本周三宣布,正式向移动端引入ChatGPT语音代理功能,使用户能够通过直接的语音指令触发起草文档、摘要邮件等复杂工作流。
文章
分类
输出
在核心技术架构上,GPT-Live-1实现了语音理解与语音输出在同一模型中的深度整合。
文章
转写
二是链路割裂——语音转写、声纹识别、语音翻译等能力被拆成独立模块串联运行,模块之间存在断点,容易累积错误,体验上也会出现延迟、卡顿。
文章
在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。
文章
语音
Talker再结合译文和源音频,把译文合成为保留原说话人音色的译文语音。
文章
识别大模型Xiaomi-CocktailASR-1
2026年09月11日14:51IT之家IT之家9月11日消息,小米技术今日发文宣布,小米正式发布并开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1。
文章
小米开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1
文章
小米开源工业级目标说话人语音识别大模型Xiaomi小米开源工业级目标说话人语音识别大模型Xiaomi-CocktailASR-1
文章
识别
与讯飞星火大模型的“1+N”体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或系统。
文章
在Fleurs、Kespeech、LibriSpeech等中英文、多语言、多方言语音识别评测中,其得分高于Gemini-3.1Pro,并在Fleurs中文测试集中取得SOTA。
文章
在多项任务中,与同尺寸的Qwen3.5-omni-flash(35B-A3B)相比,在多语言、多方言语音识别的平均效果上表现出优势;
文章
翻译
理解
智能代理
OpenAI近期正式宣布,在其ChatGPT移动应用中全面引入基于语音的智能代理(Agent)功能。
文章
同时
该模型全面支持全双工对话,不仅能让系统在输出语音的同时依然聆听用户的声音,还能在对话过程中精准处理打断、停顿以及背景噪声等复杂场景。
文章
交互
该模型的推出,标志着AI语音交互正在从传统的“分段式处理”向真正的自然对话演进。
文章
事件
2026-10-13
幕府将军2》完全版游戏公布:支持中文字幕/语音,10月13日发售
文章
效果
官方表示,Xiaomi-CocktailASR-1旨在解决“鸡尾酒会”难题(IT之家注:当前语音识别技术已经可以以较高精度识别一个人所讲的话,但是当说话的人数为两人或者多人时,语音识别率就会极大地降低,这一难题被称为鸡尾酒会问题)。
文章
它打破了传统模式中“语音转文字、大语言模型推理、文字转语音”的多次衔接壁垒,从而大幅降低了系统延迟。
文章