明略科技(2718.HK)模型上新!端侧结构化ASR语音转写时代来了
明略科技(2718.HK)模型上新!端侧结构化ASR语音转写时代来了
2026年08月06日 17:47
近日,明略科技自研的OctoASR 模型正式开源发布。 OctoASR 作为一款面向垂直领域的端侧语音识别转写模型,深度适配会议纪要、技术讨论、产品评审、研发口播等高频办公场景。
依托对行业语料的针对性优化,OctoASR 能够精准识别英文术语、缩写、产品名等专有名词及中英混合表达,有效解决通用模型常见的术语误转、中英混说断句混乱等痛点,真正实现“听得清、懂行话、写得准”。 此外,该服务完全在本地运行,开箱即用,可确保音频与转写数据不出本机,隐私数据处理更有保障。
为何 AI 时代的 ASR 如此重要?
在日常办公和社交中,语音输入因其“一键按下、随心输出”的便捷性,成为效率最高的沟通方式之一。然而,当沟通的另一端引入 AI 智能体时,传统语音的局限性便暴露无遗:AI 无法直接读取、理解群聊中随性、碎片化的语音流,加上日常口语中充斥的多变语序、错别字以及高频语气词,更是让信息提取难上加难。
随着大模型协作网络与端侧 AI 的爆发,人们对自动语音识别(ASR)的转写准确性、低时延以及隐私安全也提出了更高的要求,作为 AI 不可或缺的耳朵,ASR 能够帮助 AI 真正无缝切入人类的高频语音沟通场景。
更快,更好,更省的端侧转写体验
作为明略科技在端侧 AI 领域的最新成果,OctoASR 带来了全新的优质使用体验:
极致轻量,即说即转
模型大小仅为0.8B,并基于 Cider 针对 Apple Silicon 进行了深度优化。在 MacOS 生态下,模型可在端侧高效运行,无网络往返延迟,无需排队等待。所有的语音数据都在用户本地设备上完成解码与转写,在断网环境下同样运用自如,且彻底杜绝了隐私云端泄露的风险。
懂行话,能润色:
模型面向互联网与 IT 办公等领域语料进行深度优化,使 OctoASR 不仅能精准识别可精准识别英文术语、缩写、产品名与中英混说,还能在转写时自动提炼时间、地点、任务目标等关键要素。通过智能去噪与润色,模型可自动过滤语气词和重复词并进行语序重组,将断断续续的口语重构为符合书面规范、逻辑清晰的段落。
智能化交互对接
“@提及替换”功能可将语音中口语化的人名提及(如“艾特小明”)自动映射为规范的“@王小明”格式,确保群聊中的语音指令能被系统准确解析与执行。
零边际成本
运行过程中完全调用本地硬件算力,不调用任何云端 API,不消耗 Token,更没有按分钟计费的账单,边际成本降至为零,真正实现自由畅快、无忧使用。
OctoASR 的开源发布,是明略科技近期在端侧 AI 领域全景布局的又一块重要拼图。 目前,明略科技正在逐步完善一套端侧智能工具链,通过多个模型、工具包、应用等组件的有机结合,让 Private AI 真正变成组织和开发者触手可及、高效好用的智能解决方案。
(文章来源:界面新闻)