
李不凯正在研究
@libukai • 8,572 subscribers
从大厂到创业再到 OPC | 探索各种 AI 原创使用技巧 | 通识和应用讲座已近百场 | 中文区 No.1 Awesome-agent-skill repo 维护者 | Codex、WorkBuddy、CherryStudio 实操九段选手 | 播撒 AI 的种子,帮更多人用好 AI
Shorts
Videos

我强烈建议!不不不,我强烈要求!你们必须要尝试一下今天新出的 deepseek-v4.1-flash-expires-on-0910 + AI 专属浏览器 ego lite 的组合,在 WorkBuddy 中用这个组合比 Codex 中用 Astra 还要爽啊! 不知道是不是用的人还少,deepseek-v4.1-flash-expires-on-0910 轻轻松松飙到 300 token/s,干啥都是秒速搞定,实在是爽到极致。 而 ego lite 本身就是主打极致速度,直接用 JS 代码来进行模拟操作,速度相对使用 MCP 的方案又快了很多。 例如在下面的这个视频中,我让 WorkBuddy 帮我在淘宝中自行查找指定商品并添加到购物车,不到 50 秒它就搞定了整个流程······· 视频没有加速,真的没有加速,🤣 就在短短半年前,Browse Use 还只能算是一个玩具,无论是从 Token 消耗还是操作速度上来说都不具备实用性。 而现在,两个提升叠加到一起实现了快上加快,速度的提升又带来了体验的质变, 更别说 DeepSeek 这个价格杀手还把成本拉到了可承受的范围内。 AI 大佬们真的要这么卷吗?真的不给普通人活路了吗? 本是同根生,相煎何太急啊,😂
李不凯正在研究144,493 views • 3 days ago

今天 X 上的人都在用 Astra 做 3D 建模,我也算是跟风用 Blender 做了一个就在家门口的武汉市标志性建筑 —— 梦时代商场。 做这个商场 3D 建模的展示网站,总共用时 2 小时 33 分 56 秒,消耗了大概 20x Pro 周用量的 25%。 按照现在的 1040 左右的市场代充值行情价,折算的成本大概是 65 块钱。给做建筑设计的朋友看了看,虽然一眼能看出问题很多,但真要换成人做,成本是远远不止这一点的。 然后让 Astra 继续尝试,自己去网页上操作和录屏,并使用剪映专用版做介绍视频,用时 1 小时 15 分钟做出了下面这个,大概消耗了 10% 的周用量,折合成本 25 块钱。 这块我自己算是有点发言权,整体来说做的无功无过,如果成本能降到 10 块钱之内,那我应该会重度依赖 Astra 来做。 关于这个成本的问题,我也和 Astra 讨论了一下,它的反馈是由于剪映的操控没有 Skill,也没有 MCP 可用,导致它在探索的时候浪费了不少的时间和 Token。 所以我也让 Astra 自己去总结了一版使用经验形成 Skill,后面准备持续优化迭代,争取把用剪映自动化做视频这个流程更顺畅的跑通。 当然,还是期望剪映早日推出官方的 Skill 和 MCP,也希望 ChatCut 这样 AI Native 的产品持续进化,这个市场的空间和可做的事情实在是太大太多了。 另外一个最深刻的感受是,虽然现在提示词工程没那么重要了,但能够用专业术语把需求描述清楚的重要性越来越高了,现在已经到了使用者的能力上限严重制约 AI 的能力上限的阶段了。 不过中登们也别盲目乐观,毕竟我个人的感受是 90% 的中登说实话也没啥拿得出手的专业能力,还不如有学习能力的小朋友呢········
李不凯正在研究18,700 views • 6 days ago

人啊,要想人前吹牛逼不被打脸,就得人后多花功夫好好练! 前天小小吐槽了一下 宝玉 宝玉老师,说他做的 push-to-x skill 不够精致,连原生的代码样式都无法还原,还夸下海口要解决这个问题。 这不苦熬了 2 个晚上,终于把流程优化到位,把成功率给提升到接近 100% 了。 下面的这个视频,就是在 Obsidian 中让 Claude Code 执行 obsidian-to-x skill,把一篇嵌入了十多张图片,以及三个代码块的 Markdown 文档发布到 X Article 的全过程录屏。 总计耗时是3 分 48 秒,主要是图片的上传耗时太长,如果以文本为主,一分钟之内肯定可以解决问题。 这个帖子转发的那篇文章,就是视频中完全依靠自动化流程完成的发布,你们看看代码块的效果是不是还挺漂亮的? 优化这个 skill 的过程中,最大的挑战还是如何在 AI 的自由度和代码的稳定性之间找到最佳平衡点,既要能快速稳定完成主体流程,又要能灵活处理各种边缘情况,真是说起来容易做起来难啊。 最后,感谢宝玉老师打下的良好基础,一切荣耀归功于它。由于我在这个 skill 中针对 Obsidian 的情况做了大幅的调整,就不去提交 PR 了。 有兴趣的朋友,可以到评论中的 awesome-agent-skills repo 中的 skills 目录下翻翻看。我个人建议是,让 AI 阅读一下 skill 的内容,然后根据你的实际情况进行微调,那样的话能够达到最好的效果。
李不凯正在研究105,633 views • 6 months ago

原以为调用摄像头是个难事,没想到浏览器里的 API 封装已经如此成熟了。准备继续优化交互体验,过年的时候让几个没法放烟花的小辈过过干瘾。
李不凯正在研究73,373 views • 7 months ago

哼哧哼哧用 Codex 又改了一整天的官网,对于网页注释功能是越来越爱不释手了。 总结了几个小技巧,记录和分享一下,👇 1. 网页注释只支持 Codex 的内置浏览器。通过 Codex 在本地跑起来的服务,只需要点击输出内容中的链接即可自动唤起。 如果没有链接,也可以通过窗口最右侧的侧边栏按钮,直接打开浏览器手动输入地址唤起。 2. 注释功能分为简要和详细模式,又分别是对应单个和批量两种修改执行方式。这一点估计是很多人没有注意到的,其实是用好注释功能的关键。 3. 先说简要模式。使用简要模式,只需要在开启了注释功能之后,使用对话气泡样式的鼠标 ICON ,在需要调整的元素上点击一下,即可唤出输入框,然后直接在输入框中描述期望的修改即可。 输入完毕之后,使用回车确认,注释的内容和相关上下文就会直接到进入到 Codex 的对话框,并立即开始执行修改操作。 4. 更有价值的是详细模式。打开详细模式,需要点击注释输入框的左侧的配置 ICON。打开之后,元素对应的属性值会一览无遗,需要做什么样的修改,都可以直接手动调整最底层的细节。 同时,也依然支持通过自然语言,在上方的输入框中输入期望的调整效果。 另外,在详细模式下,此前 ⬆️ 形状的确认按钮,变成了 ☑️ 的形状。在每一个注释确认了之后,也并不会立即执行,而是可以持续的添加多个注释,最后再一起通过右上角的“发送”发送至 Codex 进行批量处理。 5. 注释模式还有一些细节做的挺用心的,例如 Esc 键的逐级取消,在Codex 对话框的样式,甚至还有个很漂亮的轻微摆动的交互效果,很明显是花了不少的心思打磨的。 作为在 AI 时代依然坚守了 VS Code 三年的老顽固,最近沉迷于 Codex 无法自拔,已经好久好久没有打开过老伙计了。 原因无他,一个超级 App ,All in One 搞定一切需求,这种顺畅感实在是让人无法抗拒,也许 Codex 真的是那个带领用户从 Vibe Coding 阶段迈入 Vibe Working 阶段的天选之子。 我郑重承诺,只要你丫不封号,我就一直充值用下去!
李不凯正在研究31,775 views • 3 months ago

这两天 ChatCut 大火,作为一个审美白痴我对视频质量发言权不大,但是必须得说这个插件的确是做的优雅,👍 简而言之,ChatCut 把 Skills 和一整套 MCP Tools 接进 Codex,项目、素材、生成任务、时间线和导出状态都由 MCP 直接与 ChatCut 后端交互;网页版编辑器处理专业剪辑界面,并且和 MCP 共享同一个项目状态。 于是 Codex 可以负责理解需求、研究资料、写脚本、做判断和编排任务,ChatCut 则继续负责素材、轨道、帧、渲染、转码这些很脏、很重、但又必须极其可靠的视频工程。 我用它做了一支 3 分钟的“中国过去十年出生人口变化”分析视频,并完整观察了一下整个的过程:查国家统计局数据,生成 6 段旁白,写 6 个可编辑 MG,按照真实音频长度对齐 5509 帧,再抽查云端渲染结果。 关键不是 AI 会不会模拟鼠标,而是 Codex 完成了 AI 最擅长的理解和编排,ChatCut 完成了专业软件最擅长的工程执行,最后我还能进入传统时间线继续修改。 我觉得这才是 Codex 插件能发挥最大价值的方式:不要每个产品都重新造一套聊天框、Agent、模型路由和通用推理,也不要让 Codex 用 Browser Use 硬猜一个复杂软件的界面;把 AI 层交给 Codex,把真正形成产品壁垒的工程层留在自己手里,中间用 MCP 建立稳定、可验证、可组合的接口。 所以说 MCP 已死,我觉得是看反了。MCP Server 的数量、套壳和“接入即智能”这类幻想确实在退潮,但 MCP 作为分工边界反而越来越重要。没有这层协议,AI 产品和专业软件只能互相侵入、重复造轮子;有了它,两边都可以把精力放回自己真正擅长的部分。 我现在更愿意把好的 Codex 插件理解成一种新型专业软件:AI 不需要住进软件里,软件也不需要把自己改造成 AI。它们通过 MCP 协作,最后把一件真实工作做完。 OpenAI 当年号称要把 GPTs 做成 AI 时代 App Store 的梦想,好像真的有那么点希望了。
李不凯正在研究20,822 views • 2 months ago

老不代表没用,尤其是在 AI 时代,老东西反而更历久弥新。 例如我花了一个月时间持续 Vibe Coding 的这个 Chrome 扩展,核心功能就是从网页上快捷抓取特定位置的内容。 面对各种稀奇古怪的网页结构,浏览器的原生 API 根本就不好使,还是用 Jquery 处理起来更方便,特别复杂的需求整个伪选择器也是分分钟的事情。 从另一个角度来说,Jquery 在前端虽然用的少了,但后端还有精神继承者 Cheerio 啊,用来处理抓取下来的 HTML 原始网页那也是爽歪歪的。 此外,虽然 Skill 最近大火,但 Prompt 在处理简单任务上,依然是大多数场景的最佳选择。 例如下面这个视频中的纯文本转图片时间轴功能,你觉得纯提示词是怎么写的呢?
李不凯正在研究12,960 views • 7 months ago
No more content to load