Loading video...
Video Failed to Load
开源项目推荐:Type4Me,作者号称是 Typeless 平替 macOS 语音输入工具,本地/云端双引擎识别,大模型文本优化,数据全部存在本地。 市面上的语音输入工具,要么贵($12/月),要么数据不可控,要么不能自定义 Prompt。Type4Me 想把这几个问题一起解决。 它基于 SherpaOnnx 引擎做本地语音识别,不需要 API Key、不需要联网,在 Apple Silicon 机型上跑得很快。如果你更看重准确率,也可以接云端引擎(目前支持火山引擎和 Deepgram)。 最有意思的是它的"处理模式"设计——语音识别出文字后,可以直接丢给大模型做后处理。内置了快速听写、双通道高精度、中译英、Prompt 优化等模式,也可以自己写 Prompt 定义任意处理流程。 还有个"命令模式"值得一提:选中一段文字,按快捷键说一句话,语音会变成指令,选中的文字变成上下文,LLM 直接执行操作并输出结果。相当于把语音变成了 LLM 的命令行。 数据方面,所有凭证和识别历史都存在本地(SQLite + JSON),没有遥测、没有云同步,历史记录支持导出 CSV。 项目架构是插件式的,添加新的语音识别服务只需要实现两个协议然后注册,目前 OpenAI Whisper、Google、AWS 等接口定义都预留好了,等社区来补。 MIT 协议,macOS 14+,GitHub 地址:
110,698 views • 6 months ago •via X (Twitter)
31 Comments

还不如用这个 这个AI输入法功能还强 还免费开源

不管用什么STT模型,即便用API, 把数据备份/留在本地真的挺重要的. 自己做的语音输入法,用了一年多,最近几个月更注意把语音存下来,已经有70多个小时带transcript的量了, 后续可以做的事情挺多的hh

为什么不用ChatGPT的语言识别输入整理,我个人认为最好识别率最高,也不需要新装什么其他软件。

和闪电说相比哪个更好

SherpaOnnx 本地语音识别模型不太行,经常识别错误,我自认为我的普通话已经非常标准了,这个模型感觉连 SenseVoice Small 都比不过。另外这个 App 看起来是用 Swift 的代码写的原生,但不知道为什么,拖动窗口大小时,整个界面顿挫感非常强烈。然后默认的语音输入键是右侧的 Ctrl 键,但是你知道,Mac 键盘右边就没有 Ctrl 键,这个设定很诡异。这个 App 如果没有这些问题的话,感觉还是很不错的。我还是继续 vibe 我自己的。

Windows馋哭了都

闪电说感觉差不多呀。

我发现一个更全一些项目:Vowrite, 支持的模型组合更多,而且支持macos的 mlx本地。

Talk 也在做类似的事,但更极简:选中文字,按住快捷键说话,松手直接替换,全程 on-device,不需要 API Key 也不需要配置引擎。Apple Silicon 原生,MLX 推理。

Spokenly 的轮子再被造一遍?

宝总,它跟微信输入法的语音输入哪个更好?

Mac 端的话 spokenly 就挺好用的

智谱输入法内置一下提示词不就可以了

“命令模式”这个设计很巧妙,选中文字当上下文+语音当指令,相当于用语音做了一个随时可用的 LLM 交互层。本地识别+插件架构也很对味,收藏了。

识别太慢了,云模型

太狠了,昨天才用了typeless,感觉打开新大陆

handy很好用 完全免费 模型本地的

使劲得在推广

微信新出的语音输入也挺好,免费的情况下完全满足日常需求了

总觉得语音输入怪怪的。

闪电说危

听起来很不错,就是这个名字,中文语境下让我的第一感觉是:"打字累死我"!

大模型不是本地的话会很慢吧

现在闪电说效果也不错,也免费

我选择闪电说

豆包好像也开始Mac 内测了,哪个效果更好?

竟然没有windows

我要安装使用

一直搞不懂,这些软件开发出来,开源之后又免费,它是从什么方面盈利的?为爱发电吗?对于好用的开源软件,我们是不是要有更好的方式去支持它?

为啥我的ASR local engine永远选不到?

蹭个热度,也推荐一下我跟朋友开发的语音输入工具,也是开源的
