打字慢且废话多?Openless:跨平台开源语音助手,松手即得AI润色文本
语音输入工具已经存在多年,但大多数只是把嘴里说的话原封不动地转成文字。用户说"那个什么,我想让ChatGPT帮我写个SQL查询,从订单表里拿上个月的数据,按客户分组,金额降序排列,取前十名",转写出来的也是这串带着语气词、逻辑跳跃的口语。接下来还得手动删掉"那个什么"“帮我”,把"拿上个月的数据"改成"查询上个月的订单记录",把"金额降序排列"改成"ORDER BY amount DESC"。语音输入节省的打字时间,全花在了编辑上。
问题在于,语音输入从来就不该止步于"转写"。人说话和写文章是两套语法,口语里有大量填充词、重复、跳跃,脑子里想到什么就说什么,不会先在嘴里打草稿。真正需要的是把"嘴里的草稿"变成"能用的文字"——这不是转写,是改写。OpenLess做的正是这件事。按住快捷键说话,松开之后,它先把语音转成文字,再调用大模型润色,最后把结果插入到光标所在的位置。整个过程一两秒,用户不需要切窗口、不需要复制粘贴、不需要手动改格式。
这个工具的核心用法是"AI提示词模式"。还是上面那个例子,用户对着OpenLess说"我想让ChatGPT写个SQL查询,从订单表拿上个月的数据,按客户分组,金额降序,取前十",松开快捷键后,屏幕上出现的是一段结构化的提示词:"请编写一个SQL查询:从orders表查询上个月的订单;按客户分组;按总金额降序排列;仅返回前10行。"不需要再编辑,直接回车发给ChatGPT。这种"说一句话,得到一个完整提示词"的体验,比打字快得多,也比单纯的语音转写实用得多。
市面上已经有类似的商业工具,比如Typeless、Wispr Flow、Lazy、Superwhisper。它们的功能大同小异:按住快捷键说话,松开后得到润色后的文字。但这些都是订阅制的SaaS服务,用户的音频数据上传到厂商的服务器,个人词典和输入习惯存在厂商的账户里,每个月还要付一笔订阅费。对于在意数据隐私、或者想用自己的模型API的用户来说,这些工具并不合适。OpenLess走的是另一条路:完全开源,数据留在本地,用户自己配置语音识别和大模型的API密钥,想用哪个服务商的模型自己决定。
这个工具不会替你回答问题。你说"这个应用还缺什么功能",它吐出来的就是"这个应用还缺什么功能?"——一个干净的问题,不是功能清单。它只做一件事:把口语变成书面语,不替你思考,不替你执行。每次语音输入都是独立的,不积累上下文,不记住你之前说过什么。这种克制反倒让人放心——不用担心模型自作聪明改掉原意,也不用担心历史数据被滥用。
写邮件、写 Slack 消息、写代码注释、写 PR 描述,凡是"不想打字但必须产出文字"的时候,都能用。经常和 ChatGPT、Claude、Cursor 打交道的人会觉得尤其顺手:脑子里想到什么需求,嘴里说出来,一两秒后拿到一段结构化的提示词,粘贴到对话框里直接用。嘴说出来就能用,比在键盘上敲敲改改顺畅。
macOS 和 Windows 都能装。装好之后填一组 API 密钥——语音识别用火山引擎的流式服务,润色用兼容 OpenAI 接口的大模型。系统托盘常驻一个小图标,屏幕上浮着一个状态胶囊,录音和润色到哪一步一目了然。按住快捷键说话,松开后自动处理,结果插到光标位置;插不进去就自动复制到剪贴板,手动粘贴。
开源的好处是代码看得见、数据留本地、想改就能改。在意隐私的人可以自己审计代码确认没有后门;有定制需求的人可以自己部署、自己改逻辑。OpenLess 的功能不比商业工具差,有些地方还更灵活——比如自定义词典,把产品名、人名、专业术语加进去,语音识别时优先匹配,润色时也会根据上下文判断要不要替换。
语音输入的下一站,是更聪明的改写。OpenLess 把这件事做成了开源、本地、可定制。

https://github.com/appergb/openless
更多推荐
所有评论(0)