正在加载视频...

视频加载失败

兄弟们,肝出来了!并且全部免费开源了! 我把PP-OCRv6直接做成了本地工作台,在Mac上用CoreML加速,一键就能切换Tiny、Small、Medium三个模型大小! Tiny只有1.5MB适合极致轻量,Medium 34.5MB主打精度,中间Small做平衡。 支持图片上传、批量处理、结果导出CSV/Markdown/Excel,历史记录自动保存。 整个东西完全本地跑,隐私安全,不用上传任何数据。 最爽的是在苹果硅上自动开启CoreML加速,Intel Mac和Linux也能CPU跑。 还专门做了浏览器版Tiny模型,零依赖直接在网页里就能用OCR。 附带评测脚本,能跟OmniDocBench和macOS自带Apple Vision对比,实际测试在弯曲表面、点阵字体、低对比度这些难搞场景表现都不错。 以前做本地OCR最烦的就是模型下载、环境配置、精度和速度权衡,现在我把这些全封装好了。 开发者、研究者、需要离线处理文档的人直接clone就能用。 这其实是我自己日常做OCR时踩了很多坑后,顺手做的东西。 希望能帮到同样有这个需求的朋友。

37,590 次观看 • 2 个月前 •via X (Twitter)

0 条评论

暂无评论

原始帖子的评论将显示在这里

相关视频

昨天发了一个视频,看到评论里有人问:你都在用 Claude Code 了,为什么还要用国内的 Coding Plan? 对我来说,这不是一个二选一的问题,而是一个补充题。 大家都知道御三家的硬实力更强,这点没什么好争议的。但很多日常场景里,国产模型其实已经能在速度、质量、成本之间取得一个不错的平衡。 比如文本处理、资料整理、基础 coding、简单 agent 任务,这类占日常 80% 的工作,很多时候并不一定非要上最贵的模型。对大多数中国用户来说,国产模型更顺手,速度也够,价格还低不少。 还有一个经常被忽略的点,其实是处理速度。 我自己实测下来,国内这些模型在一些简单任务上,接口响应和首字速度都很快。像翻译、语音输入后的文本修正、基础润色、简单改写这类高频小任务,用起来其实很舒服。你并不需要每一次都把最贵、最强的模型拉出来跑一遍。 另外我觉得,现在国内头部几家 AI 厂商,已经不是“能不能做”的问题了。无论是阿里还是字节,一方面有足够的算力和基础设施,另一方面本身也有持续做模型研发和产品迭代的能力。所以在很多高频、日常、成本敏感的场景里,把国产模型纳入自己的工具链,本来就是很自然的事。 所以我现在的看法一直都不是“国产替代”或者“二选一”,而是按场景分工:复杂、高价值任务交给最强模型;大量日常、重复、成本敏感的任务,用国产模型做补充,我觉得这反而是更现实、也更科学的用法。

luolei

32,585 次观看 • 4 个月前

这个项目,真的让我重新燃起了做账号矩阵的冲动。 一个 14.5k stars 的开源项目,直接把 Google NotebookLM 变成内容生产流水线。 NotebookLM 很多人应该都用过。 上传 PDF、网页、YouTube,它就能帮你整理资料、生成播客、做学习指南。 但官方网页版有个很难受的问题: 太慢了。 传个 PDF,等解析; 点生成音频,再等; 下载,再等。 一套流程跑完,时间全浪费在等待上。 更关键的是: 它根本不适合批量搞内容。 你想一次处理几十个链接? 想自动生成一批播客? 想接到自己的工作流里? 网页版基本没法玩。 直到我发现了 notebooklm-py。 这是一个非官方 Python API,等于把 NotebookLM 的能力全拆出来了。 很多功能甚至比网页版还狠: - 一行命令生成播客 - 支持不同风格、时长、语言 - 批量导入 YouTube / PDF / URL - 幻灯片直接导出 PPTX - 思维导图导出 JSON - 数据导出 CSV - 测验题结构化导出 - 还能用自然语言改单页 PPT 最强的是: 它还能接进 Claude Code,当 Agent 技能用。 看到这里我脑子里第一反应就是: 这不就是账号矩阵生产线吗? 热点抓取 → AI研究 → 播客生成 → 图文整理 → PPT生成 → 自动分发 整个链路都能串起来。 以前做矩阵,拼的是人多。 现在越来越像拼工作流了。 很多以前需要团队才能做的事情, 现在一个人也能跑起来。

开发者Hailey

21,316 次观看 • 3 个月前

推荐个好东西:火山引擎的 PromptPilot。 之前看 Google 的提示词白皮书,有个点让我印象很深: 他们直接用 Google Doc 管理 prompt,写任务、版本、评估效果。 那时候我就在想,有没有人真把这事儿做成一套完整系统? 现在看到火山这套,有点意思了。 它不只是“帮你写好提示词”,而是把这事儿当作工程问题来解的。 最打动我的,是它在 prompt 优化这件事上做得极其系统,甚至有点狠。 ✅ 从任务出发构造 prompt(带结构、带变量、不是拍脑袋) ✅ 每一版 prompt 都挂着独立评测集 + 自动评分机制 ✅ 没有理想答案也能比对打分(GSB 模式) ✅ 每轮迭代都能 trace 效果,版本可控、可回溯 我们之前做客服对话调 prompt,最常见的就是“改了一句,但说不上来到底有没有变好”。 很多时候上线的版本其实就是“看着还行就先上”。 现在它是:“打一套样本集,系统直接帮你跑出哪一版效果稳定”。 我一直坚持: 模型越强,对 prompt 的要求只会更高。 尤其是在多轮任务、复杂场景里,prompt 不只是“写得好”,而是“是否可控、可管理、可进化”。 PromptPilot 解决的,是这个底层问题。 它不仅能让 prompt 生出来,更重要是——能持续改下去。 版本有 trace,样本能评分,逻辑能反推,工具还能外接, 整个就是“prompt 的 AutoML + GitOps” 一体化工具链。 顺带说一句:这是 2025 火山引擎 FORCE 大会上刚发布的产品,免费版和 Plus 版都开放,9 月前能直接上手全功能体验。 现在市面上很多 prompt 工具做的是“编辑器 + 改写器”, 但你会发现,真正上线之后需要的是一整套治理机制。 PromptPilot 是我目前看到国内第一个跑通这个闭环的, 不是 fancy 的界面,而是认真在解决 prompt 系统演化能力这个问题。 如果你也在做 AI 应用落地,推荐你认真研究一下。 要说缺点:自定义模型没找到海外模型,差评!

凡人小北

95,078 次观看 • 1 年前

兄弟们,DeepSeek V4 Pro在ZenMux上免费放开了,登录就能跑,实测能替掉你80%的Claude活。视频是我早上实测的和Claude opus 4.7同时跑一个昨SaaS产品网站的任务,效果真的炸裂! 说个前情,老朋友都知道我今年Claude被封过一次号,那之后我就想通一件事——API这种东西绑死在单一厂商手里是给自己埋雷,付费用户说封就封,申诉通道石沉大海,深夜破防一次就够了。 从那之后我转战聚合平台,试了一圈最后留在ZenMux,半年用下来没再折腾过。 所以这次V4 Pro在ZenMux上免费开放,对我来说不是又一个新模型上线,是我一直在用的平台又多了一张能打的牌,顺手就想推给兄弟们。 先说V4 Pro到底值不值得冲, 这几天X上吹V4 Pro的推刷屏了,参数跑分价格屠杀,都是同一个模板。 但对我这种每个月真金白银付API账单的人来说,跑分都是虚的,能不能替掉我手头项目里的Claude调用才是真问题。 免费窗口就是用来验证这件事的, 我这昨天就干了一件事——用ZenMux的PK模式把V4 Pro、GPT-5.4、Claude Opus 4.6摆在同一屏,拿自己项目里最头疼的prompt开跑,三栏并排输出,谁快谁慢谁token烧得少一眼看完。 四个场景跑完结论很清晰——日常80%的活V4 Pro能接,便宜到让我下不去手再用Opus,剩下20%极限稳定性的关键链路我还是留给Claude兜底。 这就是模型分层,上周讲Ling的时候也提过这个逻辑,2026年不存在一个模型打天下,只存在你工具箱里的模型组合。 顺便说说ZenMux这平台为啥值得留下来。 PK模式是第一个杀手锏,三家模型同屏对比这种功能市面上很少有平台做,每次选模型省我一整个下午,比自己写脚本调三家API再人肉对比快十倍。 真正让我踏实的是保险赔付机制,模型输出异常或者延时拉胯,平台自动检测并补偿。 被Claude封过号之后再看到这个设计,感觉完全不一样,出问题有人兜底,不用再深夜破防。 再加上日志、成本、用量、性能四个维度的可观测性做得细,每一笔钱烧在哪、每一次请求卡在哪点开就能看,调prompt和选型的时候非常好使。 回到这次的白嫖窗口, DeepSeek V4 Pro和Flash都有免费版,每天有用量限制但够你跑测试。 这几天想验证要不要换模型的兄弟,别再刷跑分推了,自己扔几个真实prompt进去跑一遍,十分钟你就知道该不该换,比谁的测评都诚实🌚 免费入口老规矩评论区自取⬇️ #DeepSeekV4 #ZenMux #AI #大模型 #Agent

AYi

132,811 次观看 • 4 个月前

做AI短视频,我踩过 5 个坑 今天全说出来,希望你能少走一些弯路。 ──────────────── 第一坑:一上来就猛学 刚开始做的时候,我每天研究工具、研究技术、研究别人怎么做。研究得很起劲,但回头一看,一个视频都没做完。 正确的顺序是先做出来,再边做边学。做完第一个你懂了流程,做完几个你有了感觉,就这样进步 总结一句:先完成,再完美 ──────────────── 第二坑:总想省钱省积分 生图要钱,生视频要钱,心疼是真的 刚开始做的时候,我也试过那些便宜的方案,效果看起来差不多。实际用下来,各种问题,花了大量时间去调,最后还是放弃了。 成本要跟结果比,不是跟价格比。做一个视频的成本本来就不高,省那点钱,丢的是时间和机会。 总结一句:用最好的工具,做最好的作品 ──────────────── 第三坑:死抠画面 刚开始做的时候,总想把画面做得很精美。结果发现根本做不到,提示词再好也有上限。 后来才发现,很多播放量很高的视频,画面并不精致,但内容抓人、节奏好,照样爆。 总结一句:别死抠视觉,够用就行。 ──────────────── 第四坑:忘了内容本身 这是最大的坑 刚开始做的时候,我花了大量时间研究工具、研究技术,结果忘了自己是做内容的 我们做的是视频,第一件事是内容好不好,不是特效漂不漂亮。 把注意力放回内容上之后,效果立刻就不一样了。 总结一句:我们是做内容的,不是研究AI的 ──────────────── 第五坑:做得太少 做一个感觉效果不好,就开始大改、大优化。其实很可能是这个方向用户不感兴趣,换一个方向就好了。 只要数量足够多,总会有跑通的 总结一句:干就完了,量大出奇迹 ════════════════ 我现在用什么工具 工具不用多,我现在核心就靠Creao 🔹 视频生成— 支持 Google Veo 和 Seedance,提示词直接出视频 🔹 图片生成— 最高 4K,随时在对话里生成 🔹 配音 — 20 多种声音,直接出音频文件 🔹 Agent 自动化 — 流程搭好之后可以定时跑,不用每次手动 可以试试: 最后一句:别光收藏,动手才能进步

Powerpei🦅🏆买美股上币安

22,183 次观看 • 1 个月前