Loading video...

Video Failed to Load

Go Home

在 GitHub 上发现一个开源项目:Memvid,颠覆传统的向量数据库处理方式,直接将文本数据编码成视频文件。 通过将数百万文本块压缩到单个 MP4 文件中,不仅实现了 10 倍的存储压缩率,还能在亚秒级时间内完成语义搜索,完全无需数据库服务器。 GitHub: 并且内置对话功能,可与知识库进行上下文感知的对话,同时支持直接导入 PDF 文档并自动索引处理。 可完全离线工作,视频生成后无需网络连接。正在构建大型知识库的 AI 开发者不妨看下这个项目。

57,673 views • 1 year ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

Codex 5.6 必装 Obsidian,直接给 AI 装上安全免费的本地永久记忆库! 很多人想给 AI 增加长期记忆,但又担心云端 Memory 成本、隐私和数据安全问题 今天我找到了正确的解决方法:让 Obsidian 成为 Codex 的外部知识中枢,让Codex 根据当前需求检索相关知识;完成任务后,再把新的经验、结论和变化同步回知识库。 检索知识 → 执行任务 → 沉淀经验 → 优化知识库 直接用下面这段prompt(提示词): “请将当前 Obsidian 知识库作为我的跨项目长期记忆系统,为所有项目建立统一索引和知识结构。持续整理并维护项目背景、长期偏好、关键决策、已完成内容、当前进度、失败方案、踩坑记录、技术方案和下一步计划。 每次开始新任务前,先检索 Obsidian 中与当前任务相关的笔记,补充必要上下文后再执行任务;任务完成后,将新增的结论、重要决策、代码变更记录和项目进度同步更新到对应文档。 只保留未来有价值的信息,避免记录无关对话、重复内容或临时信息;不要保存密码、api Key、token 等敏感信息。” 还可以创建个自动化流程: “每次完成重要任务后,让 Codex 自动提取本次开发中的关键经验,包括技术决策、解决方案、踩坑原因和可复用方法,沉淀回 Obsidian,持续完善项目知识库。” 随着项目不断推进,Obsidian 不只是存储文件,将逐渐成为属于你的 AI 知识库大脑。

govin.eth | G哥

115,934 views • 2 days ago

Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。 你可以使用工程手段来加速推理,例如将语音分片后并发处理然后合并结果,但这里涉及到本地计算资源瓶颈的问题,以及合并分片时容错处理的问题,工程复杂度比较高。 《Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling 》, Whisper 的 Large-v2 model 生成了一系列的 soft targets(也就是概率分布),然后复制 Whisper 网络的第一层和最后一层解码器,最后生成了一个更小、更快效果更好的蒸馏模型 Distil-Whisper。论文数据写的是:速度提高了 5.8 倍,参数减少了 51%,准确度保持在 99%。 这个模型的效果之所以不错,主要还是得益于训练数据的完备,它结合了九个公开可用的语音识别数据集,合并后包含 21170 小时的语音数据,涵盖超过 18260 名说话者和 10 个不同的领域;自从 Whisper 大力出奇迹(它从互联网爬取了 68w 小时的数据,未公开)以后,相信后续语音领域的论文都会配置更庞大的数据集。 Distil-Whisper 目前开源在 Hugging Face 上,模型地址: Demo: Demo 会把模型下载到本地,然后通过 WebGPU 直接在网页上跑起来,测试了下效果,还是挺不错的。 目前仅支持英文,如果想让它支持中文,需要使用同样海量的中文语料数据,重新做一次知识蒸馏,但我觉得即便是这样做,效果也不一定好,因为 Whisper 本身对中文、韩语等支持就不太优秀,这个信息可以从 Whisper 的论文中找到数据支撑。 下面这个视频是 Whisper 和 Distil-Whisper 的对比效果:

Barret李靖

124,227 views • 2 years ago