MOSS-Transcribe-Diarize 开源:一次输出“谁在何时说了什么”
一场会议结束后,真正麻烦的往往不是把声音变成文字,而是把多人对话重新整理清楚:谁说了什么、这句话发生在什么时候、相隔半小时再次出现的声音是不是同一个人。传统方案通常需要语音识别、说话人分离和时间对齐等多个环节串联;MOSS-Transcribe-Diarize想做的,是让一个模型在一次推理中把这些信息一起交付。

不只是转文字,还要回答三个问题
普通语音转写关注“说了什么”,但多人会议、访谈或播客还需要回答另外两个问题:“是谁说的”和“什么时候说的”。这类任务被称为带说话人归属与时间戳的转写(SATS)。如果先识别文字,再用另一个系统判断说话人,前一步的错误会传到后一步;遇到插话、重叠发言或相似声线时,人物标签还可能在中途漂移。
MOSS-Transcribe-Diarize 定位于会议、电话、播客、采访、课程和视频等长音频场景。采用端到端思路,把语音内容、说话人标签和时间范围放进同一条输出。例如,一段结果可以写成“[0.48][S01] Welcome everyone [1.66]”:开头是起始时间,中间的 S01 代表匿名说话人,结尾是结束时间。对使用者来说,这不是一堆需要再次拼接的中间结果,而是一份已经具备结构的对话记录。
这一步的价值很实际。会议纪要可以按人回溯观点,客服录音可以定位坐席与客户的发言,视频字幕可以直接获得分段时间,内容团队也更容易从长访谈中检索某位嘉宾的原话。模型还可按需标注非语音事件、重叠或打断,为后续摘要、质检与内容剪辑保留更多线索。
0.9B 模型,如何听完一场长会议?
此次开放的MOSS-Transcribe-Diarize 0.9B 约有9.085 亿参数。模型并不是简单把现成语音识别器和大语言模型摆在一起:它以Whisper-Medium配置的音频编码器提取声音特征,通过时间合并与适配模块把音频表示送入类似Qwen3-0.6B的文本解码器,再由解码器统一生成时间戳、说话人标签和文字。

它最醒目的能力,是面向长音频保留全局上下文。技术报告给出的上下文窗口为 128k,可在不切块的情况下处理最长约 90分钟输入。
这意味着模型可以在更长范围内记住说话人的声音与对话线索,减少音频被切成小段后出现的“前后不是同一个人”问题。这里的关键不是单纯听得更久,而是在整场对话中维持人物标签、话题与时间顺序的一致。
0.9B版本还把能力扩展到了更接近实际使用的范围:
- 长音频转写:一次处理最长约 90 分钟的音频或视频,并生成分段时间戳。
- 多人区分:自动使用 [S01]、[S02] 等匿名标签,减少额外说话人分离流程。
- 50 多种语言:官方模型页称训练覆盖50+ 语言,可用于多语种转写与说话人区分。
- 热词提示:可以加入产品名、人名或行业词,帮助模型更稳定地识别专有名词。
- 结构化导出:项目提供 JSON、SRT、ASS 等输出,并可衔接字幕审校与视频烧录。
它的优势,不能只看“字认得准不准”
多人转写的评测不能只看文字错误率。本次模型同时采用 CER、cpCER 与 Δcp:CER 主要观察文字识别,cpCER 把说话人归属也纳入计算,Δcp则可以理解为“因为分错人而额外增加了多少错误”。这些指标越低越好。最简单的理解是:一份逐字准确但把甲乙双方混在一起的记录,仍然不是一份好用的会议稿。

采用三类差异明显的场景对比:AISHELL-4 是接近 40 分钟、包含 5—7 位说话人的真实会议;Podcast平均超过 44 分钟,人数从 2 位到 11 位;Movies则由大量短片段组成,重点考验快速轮换、重叠发言与多语言内容。这样的组合比只测干净的单人录音更接近日常难题。

从结果看,MOSS Transcribe Diarize 在 AISHELL-4、Podcast、Movies 与 Alimeeting 等数据上取得了较低的 cpCER;尤其在长会议和多人播客中,文字识别与说话人归属之间的差距保持得更小。这说明它的重点并非只把句子听对,而是尽量让“内容—人物—时间”三者保持一致。
更类似音频的“结构化入口”
MOSS-Transcribe-Diarize 的想象空间,不只是一款转写工具。它输出的是带人物与时间坐标的文本,后续系统可以据此继续做摘要、观点提取、风险词检索、嘉宾切片、字幕生成或知识库入库。对内容运营而言,一段一小时访谈可以先被整理成可检索的角色对话,再按嘉宾提炼金句;对企业而言,会议或客服录音也更容易进入可审计、可回溯的分析流程。
当然,它仍有清晰边界。匿名标签只能说明同一段录音里的 S01、S02,并不会天然知道真实姓名;极端噪声、多人同时讲话、口音与罕见专有名词仍可能造成错误;90 分钟长上下文也意味着更高显存与推理成本。对于法律、医疗、财务等高风险记录,自动转写应该作为初稿,最终仍需人工核对原音频。
语音识别正在从“把声音变成字”走向“把一场对话还原成结构”。
MOSS-Transcribe-Diarize 的意义,正在于用一个不足10 亿参数的开源模型,把转写、说话人区分和时间戳放进一次生成,并把最长约90 分钟的多人音频纳入同一上下文。它未必消灭人工校对,却可能大幅减少从录音到可用内容之间最繁琐的整理工作。
社区地址
OpenCSG社区:
https://opencsg.com/models/OpenMOSS-Team/MOSS-Transcribe-Diarize
Hugging Face社区:
https://huggingface.co/OpenMOSS-Team/MOSS-Transcribe-Diarize
OpenCSG vs 魔搭:如何选择?
| 维度 | OpenCSG/CSGHub | 魔搭/ModelScope |
| 平台定位 | 企业级AI资产管理中心 | 面向开发者和AI 社区的MaaS平台 |
| 本地部署对象 | 一套模型资产管理平台本身 | 偏向模型、SDK 和工具链的本地使用 |
| 是否支持私有化/离线化 | 明确支持私有化部署、离线运行 | 支持模型下载、本地缓存、本地训练/推理等能力 |
| 开源代码 | 平台型产品本身 | SDK 和大量工具链项目 |
| 管理能力 | 模型、数据、代码、应用的统一资产治理。 | 管理模型使用链路 |
模型部署和推理使用在魔搭、OpenCSG 等模型社区中均可实现,但OpenCSG/CSGHub 的核心在于,它不只是让模型“跑起来”,而是进一步支持企业把模型、数据集、代码和应用等 AI 资产放到本地、内网或离线环境中统一管理。它解决的不只是“模型怎么部署、怎么调用”的问题,更是“模型进入企业后如何被安全管理、版本沉淀、权限控制和持续运营”的问题。
对于企业来说,CSGHub 可以帮助构建自己的私有模型资产中心,降低对外部平台的依赖;对于个人开发者来说,也可以用更系统的方式管理模型、实验项目和 AI 应用流程。相比更偏向模型发现、体验和使用入口的魔搭,CSGHub 更适合那些希望把 AI 能力真正沉淀下来,并长期维护、持续迭代的用户。
关于OpenCSG
OpenCSG是全球领先的开源大模型社区平台,致力于打造开放、协同、可持续生态,AgenticOps是人工智能领域的一种AI原生方法论,由OpenCSG(开放传神)提出。AgenticOps是Agentic AI的最佳落地实践也是方法论。核心产品 CSGHub提供模型、数据集、代码与 AI 应用的 一站式托管、协作与共享服务,具备业界领先的模型资产管理能力,支持多角色协同和高效复用。
更多推荐

所有评论(0)