Loading video...

Video Failed to Load

Go Home

开源项目推荐:Type4Me,作者号称是 Typeless 平替 macOS 语音输入工具,本地/云端双引擎识别,大模型文本优化,数据全部存在本地。 市面上的语音输入工具,要么贵($12/月),要么数据不可控,要么不能自定义 Prompt。Type4Me 想把这几个问题一起解决。 它基于 SherpaOnnx 引擎做本地语音识别,不需要 API Key、不需要联网,在 Apple Silicon 机型上跑得很快。如果你更看重准确率,也可以接云端引擎(目前支持火山引擎和 Deepgram)。 最有意思的是它的"处理模式"设计——语音识别出文字后,可以直接丢给大模型做后处理。内置了快速听写、双通道高精度、中译英、Prompt 优化等模式,也可以自己写 Prompt 定义任意处理流程。 还有个"命令模式"值得一提:选中一段文字,按快捷键说一句话,语音会变成指令,选中的文字变成上下文,LLM 直接执行操作并输出结果。相当于把语音变成了 LLM 的命令行。 数据方面,所有凭证和识别历史都存在本地(SQLite + JSON),没有遥测、没有云同步,历史记录支持导出 CSV。 项目架构是插件式的,添加新的语音识别服务只需要实现两个协议然后注册,目前 OpenAI Whisper、Google、AWS 等接口定义都预留好了,等社区来补。 MIT 协议,macOS 14+,GitHub 地址:

110,698 views • 6 months ago •via X (Twitter)

31 Comments

FreeWill 启蒙哥's profile picture
FreeWill 启蒙哥6 months ago

还不如用这个 这个AI输入法功能还强 还免费开源

G_Z's profile picture
G_Z6 months ago

不管用什么STT模型,即便用API, 把数据备份/留在本地真的挺重要的. 自己做的语音输入法,用了一年多,最近几个月更注意把语音存下来,已经有70多个小时带transcript的量了, 后续可以做的事情挺多的hh

Tigris | 会讲课教授是好老师's profile picture
Tigris | 会讲课教授是好老师6 months ago

为什么不用ChatGPT的语言识别输入整理,我个人认为最好识别率最高,也不需要新装什么其他软件。

juiyree's profile picture
juiyree6 months ago

和闪电说相比哪个更好

Lex Tang's profile picture
Lex Tang6 months ago

SherpaOnnx 本地语音识别模型不太行,经常识别错误,我自认为我的普通话已经非常标准了,这个模型感觉连 SenseVoice Small 都比不过。另外这个 App 看起来是用 Swift 的代码写的原生,但不知道为什么,拖动窗口大小时,整个界面顿挫感非常强烈。然后默认的语音输入键是右侧的 Ctrl 键,但是你知道,Mac 键盘右边就没有 Ctrl 键,这个设定很诡异。这个 App 如果没有这些问题的话,感觉还是很不错的。我还是继续 vibe 我自己的。

Awoo's profile picture
Awoo6 months ago

Windows馋哭了都

雾都Chris's profile picture
雾都Chris6 months ago

闪电说感觉差不多呀。

UncleJoe's profile picture
UncleJoe6 months ago

我发现一个更全一些项目:Vowrite, 支持的模型组合更多,而且支持macos的 mlx本地。

Duoduo's profile picture
Duoduo6 months ago

Talk 也在做类似的事,但更极简:选中文字,按住快捷键说话,松手直接替换,全程 on-device,不需要 API Key 也不需要配置引擎。Apple Silicon 原生,MLX 推理。

Ryan-the-hito's profile picture
Ryan-the-hito6 months ago

Spokenly 的轮子再被造一遍?

王挽Fwrd's profile picture
王挽Fwrd6 months ago

宝总,它跟微信输入法的语音输入哪个更好?

文森策's profile picture
文森策6 months ago

Mac 端的话 spokenly 就挺好用的

ljh's profile picture
ljh6 months ago

智谱输入法内置一下提示词不就可以了

Ne0@Digital's profile picture
Ne0@Digital6 months ago

“命令模式”这个设计很巧妙,选中文字当上下文+语音当指令,相当于用语音做了一个随时可用的 LLM 交互层。本地识别+插件架构也很对味,收藏了。

围城's profile picture
围城6 months ago

识别太慢了,云模型

Dexter AI's profile picture
Dexter AI6 months ago

太狠了,昨天才用了typeless,感觉打开新大陆

den's profile picture
den6 months ago

handy很好用 完全免费 模型本地的

Kelvan Sun's profile picture
Kelvan Sun6 months ago

使劲得在推广

Aaron's profile picture
Aaron6 months ago

微信新出的语音输入也挺好,免费的情况下完全满足日常需求了

AI最严厉的父亲's profile picture
AI最严厉的父亲6 months ago

总觉得语音输入怪怪的。

momo_0xff's profile picture
momo_0xff6 months ago

闪电说危

烁皓's profile picture
烁皓6 months ago

听起来很不错,就是这个名字,中文语境下让我的第一感觉是:"打字累死我"!

Ersic's profile picture
Ersic6 months ago

大模型不是本地的话会很慢吧

画伞's profile picture
画伞6 months ago

现在闪电说效果也不错,也免费

Harvey Zhao's profile picture
Harvey Zhao6 months ago

我选择闪电说

Josh's profile picture
Josh6 months ago

豆包好像也开始Mac 内测了,哪个效果更好?

LukeWang's profile picture
LukeWang6 months ago

竟然没有windows

ClearSky's profile picture
ClearSky6 months ago

我要安装使用

瑞哥Eric|AI |薄肌赚钱版's profile picture
瑞哥Eric|AI |薄肌赚钱版6 months ago

一直搞不懂,这些软件开发出来,开源之后又免费,它是从什么方面盈利的?为爱发电吗?对于好用的开源软件,我们是不是要有更好的方式去支持它?

John's profile picture
John6 months ago

为啥我的ASR local engine永远选不到?

Felix 的上下文's profile picture
Felix 的上下文6 months ago

蹭个热度,也推荐一下我跟朋友开发的语音输入工具,也是开源的

Related Videos

女朋友一生气就切方言,男朋友一句都没听懂,字幕全听懂了。 四川话、粤语、英语、法语,11 句台词,AI 字幕一个字没改,11 句全对。 短片是我做的,字幕交给一个开源语音模型,它输出什么我就往视频里贴什么。右上角挂着"未人工修改",连男生结巴的那句"你你说啥"都原样留着。 同一段音频我喂给了 Whisper large-v3 做对照,差距比我预想的大: 粤语那句"你话过请我食饭㗎,唔好赖账",Whisper 写成"你曾說過請我吃飯的,不要賴帳",翻成书面中文了,粤语原文一个字不剩;这个模型写的是"你话过请我食饭噶唔好赖帐",唔、噶、话过全在,广东人一看就是原话。 四川话的"莫"和"要得",Whisper 写成"别"和"要的";它原样保留。 英语那句 "Seriously? You forgot again?",Whisper 整句漏掉,它一字不差。 这个模型叫 Hojo-ASR-Multi-V1。它改掉的规则只有一条:不翻译你说的话,你说什么字,它就写什么字。 视频之外我还单独跑了两轮数据。上一期 90 条欧洲五语种真人音频,干净音频它比 Whisper 略输一点,加噪和 1.4 倍速后反超,90 条里零语言误判、零幻觉,Whisper 则把一句意大利语认成了瑞典语。这期 30 条中文系加英语:普通话、英语双方全对;粤语按字算,它错 7%,Whisper 错 50%,错的全是"翻译"造成的;四川话它错 3%,Whisper 错 11%。 更有意思的是,模型页面到今天还写着"中文、英文待支持"。Credits 里鸣谢了 WenetSpeech-Chuan 和 WenetSpeech-Yue 两个川渝、粤语数据集,能力其实早就训进去了,只是文档没跟上。 想自己上手:pip install hojo-asr,权重 12GB 从 Hugging Face 拉,Mac 上 CPU 跑 float32 就行,峰值内存 20GB。前面接一个 VAD 按停顿切句再送进去,这是这类大模型底座语音模型的标准用法,逐句识别时语言切换更稳。输出是全小写无标点,做字幕直接用,要标点的场景自己补一步。 不适合谁:16GB 内存的机器别试;中文长音频我还没测过,这次只测了短句和这条短片。 Apache 2.0,商用也行。他们的官方账号是 HojoAI,roadmap 上写着推理引擎和小型化,什么时候能塞进耳机我会一直盯着,想跟进的可以关注一下。

雨哥向前冲

529,723 views • 8 days ago