写作原则:尽量不废话,直奔主题。

      8月17日,AI语音交互公司Wispr宣布完成2.8亿美元B轮融资,Menlo Ventures领投,投后估值达20亿美元,累计融资3.61亿美元。资金核心投向是会议场景——Wispr从个人听写工具向企业会议助手转型,推出Notetaker会议笔记产品,并成立Wispr Interface Labs探索下一代人机交互界面。会议,成为本轮融资故事的核心叙事。

1.会议场景对边缘AI的刚性需求

    Wispr将战略重心押注会议场景,基于企业协作中三个无法回避的刚性约束:

    实时性。 多人在线会议中,语音转写与摘要生成需快速完成,云端处理受网络条件制约,在带宽不足时可能影响实时性。

    隐私合规。 会议内容涉及商业机密,企业明确要求音频数据不得上传第三方云端。当前,Otter正因未经参会者同意录制会议并用于AI模型训练而在加州面临集体诉讼。Granola也被指控其软件以隐身为卖点,其他参会者无法察觉会议正被录制,且默认启用模型训练、需用户手动退出。这些案例凸显了纯云端会议记录工具的合规风险。

    连续性。 跨国会议常遇网络波动,云端方案在带宽不足时直接失效。

    三重约束共同指向同一技术方向:计算向端侧下沉。

2.Notetaker:端侧捕获与云端协同的产品设计

    设备端音频捕获。 Notetaker不作为机器人加入会议,通过Mac直接捕获系统级音频,不发送bot加入通知。这一设计使其不受Zoom、Teams等平台API政策限制,也规避了平台封禁bot的风险。

    端云协同的架构选择。 Notetaker并非纯本地运行的产品,Wispr要求用户必须开启“私有云同步”才能使用会议录制功能,关闭该选项则Notetaker不可用。开启后,音频和转录文本均会存储于Wispr服务器并跨设备同步。用户可开启“隐私模式”禁止Wispr将使用数据用于模型训练——该模式控制的是“您的使用数据(包括转录文本)是否用于评估、训练和改进Flow”,但转录、摘要、行动项等功能依赖云端处理。

    合规责任的分配。 Wispr在条款中明确:用户须自行获得法律、合同或公司政策所要求的通知或同意。在加利福尼亚等11个“双方同意”州,这意味着用户需获得每位参会者的明确同意才能合法录音——合规责任在用户而非Wispr。

    上下文增强与定价。 Notetaker可调用Flow中存储的个人词典及日历信息,自动识别发言人标签和公司术语。产品已在macOS上线,提供免费版(含用量限制)和Pro版(15美元/月或12美元/年付),Windows支持“即将推出”。

3.Canto:为真实声学环境训练

    支撑Notetaker会议场景表现的核心资产,是Wispr自研语音识别模型Canto。

    行业数据显示,主流语音识别系统在实验室“干净”音频下表现良好,但在嘈杂环境、口音等真实条件下,词错率(WER)普遍超过30%。Canto通过大量真实场景样本训练——涵盖背景交谈、犬吠、交通噪音等复杂声学环境——将错误率降至5%-10%,用户可减少约30%-35%的编辑需求。

    Canto的发布恰逢用户反馈Flow听写质量下滑数周之后,Wispr将此归因于从第三方引擎向自研模型的切换。这表明Wispr正从应用层公司向自研AI技术公司转型,通过自持模型针对Flow产生的真实使用场景进行持续优化。

4.竞争格局:端侧与云端的路线分野

    Wispr进入的会议场景已有多个玩家布局,但技术路径存在显著差异:

    Wispr的差异化在于:不加入会议即不会被平台屏蔽,而依赖机器人接入的方案随时面临API政策变化风险。但差异化带来的合规成本同样明确:用户而非Wispr承担告知与同意的法律责任,且录音在“双方同意”州需获得每位参会者明确同意。

    潜在挑战同样不容忽视:如果苹果或微软在操作系统层面原生提供端侧会议语音能力,Wispr的独立价值将面临压缩。20亿美元估值的合理性,最终取决于Canto在真实会议环境中的准确率能否持续领先,以及Notetaker能否在用户粘性上形成护城河。

说明:1.本文参考公开报道并借助AI工具进行整理和分析,如有不妥之处欢迎指正。2.部分市场数据基于行业估算、发布以及官方报道,具体精确数据请以权威机构为准。3.欢迎长期追踪边缘AI的朋友一起探讨。

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐