Video wird geladen...
Video konnte nicht geladen werden
你看看这个 牛逼plus。 这个大哥基于whisper的模型搞了离线CPP版的。可以做到实时语音识别,效果非常好。
214,542 Aufrufe • vor 3 Jahren •via X (Twitter)
10 Kommentare

owlvor 3 Jahren
之前chrome的soda也有人抠出来做这种事情。

DaemonEyevor 3 Jahren
你可以看下vosk 前段时间我写过相关的东西,性能已经足够好了,没必要aws

MonsterCodervor 3 Jahren
研究了一下这个repo,他是把语音流缓存为每个半秒的wav,然后识别。这样的话可能准确度不佳。不过以您的应用场景说不定会有意想不到的惊喜😀

Rainiervor 3 Jahren
嗯嗯。我还没有试试他复杂背景下语音识别做的怎么样。我这几天试试。。

Divramvor 3 Jahren
他开始做的时候我就发现了,基本上整个用c++把pytorch的底层重写了一遍…速度非常快

Klein Huvor 3 Jahren
能不用gpu 做到视频上的水平,已经是赢家了好吧。我知道的能做到这个水平的商用客户,都是用gpu 的

Kevinvor 3 Jahren
有方言的语音识别还是讯飞厉害,不知道有没有开源。

hydravor 3 Jahren
不知道zoom用的什么技术 开会同声字幕识别很准确

比特币百舸争流vor 3 Jahren
讯飞语音输入法

不宅没技术vor 3 Jahren
这个是真的厉害
