
泊舟
@bozhou_ai • 28,826 subscribers
AI Coding / Agent 实战派 帮编程新手和老板用 AI 把想法做成工具、产品和内容 分享教程、工具和 AI 资讯 合作 V:bozhou_ai
Shorts
Videos

市面上 Codex 的教程太散了。 官方文档一块、视频一块、各路博主又一块,新手想系统上手,光把这些东西拼到一起很花时间。 所以我和小伙伴花了十天,自己整理出一本《Codex 橙皮书》。今天免费开源,直接拿走。 一份 PDF 206页,从零到能用 Codex 跑通真实项目,挨个章节啃下来就够: 一. 先搞懂 Codex 是什么 它和 ChatGPT、Cursor、Claude Code 到底差在哪,四个入口怎么选,先把概念捋清楚。 二. 安装、配置与环境准备 App、CLI、IDE 插件、Web 四端,从下载到第一次跑通,一步步带着做。 三. 核心功能详解 自动化、插件、Skill、MCP、Git/GitHub、云端运行、记忆系统 AGENTS.md,一个个讲透。 四. 标准工作流 我们自己跑出来的标准六步法,再配一套能直接复制的任务模板。 五. 实战案例库 从宠物零食官网、管理后台,到招商 PPT、宣传视频,五个案例手把手做完。 全程中文,面向小白,配了一大堆实测截图。我们踩过的坑,基本都写进去了。 开源地址:
泊舟1,387,330 görüntüleme • 1 ay önce

过去两年,AI 视频一直在卷画质、时长和真实感。 但对世界模型来说,生成得越长,反而越容易暴露一个致命问题:它根本记不住自己刚刚生成过什么。 AlayaWorld 想解决的,就是这个比画质更难的问题。 一段视频,只要前后几帧看起来连贯,观众通常不会深究背后的空间是否真的存在。 但世界不一样。 你往前走了一段路,转身回来,刚才的房子还得在那里。 你中途召唤了一只怪物,模型不但要马上给出反馈,还得让这件事自然地发生在同一个世界里。 这也是为什么世界模型最难的地方,不是生成,而是状态管理。 AlayaWorld 为这件事加了三层机制: 1. 3D Cache 负责记住东西在哪里。模型离开一个区域再回来时,可以重新找到之前的空间信息。 2. 压缩后的画面历史负责记住刚才发生了什么。它不需要把所有旧画面一直塞进上下文,但又不能把过去全部忘掉。 3.漂移训练和 Error Bank,负责处理模型自己制造的错误。因为生成时间越长,前面一个小错误就越可能污染后面的所有画面。 看到这里,我突然发现,世界模型和 Agent 其实在解决同一个问题。 Agent 运行久了会 context rot,忘记原始任务,被错误的历史信息带偏。 世界模型运行久了也会,只不过它忘记的不是文字,而是街道、建筑、人物和刚刚发生过的事。 所以 AI 的下一场竞争,可能不只是生成质量。 视频模型比的是单次输出。 世界模型比的是持续运行。 谁能让 AI 在运行过程中记得住、改得动、错了还能拉回来,谁才有机会把一次生成变成一个真正可以进入的世界。 AlayaWorld 目前还更像研究级原型。公开的推理流程需要首帧图片、相机轨迹和 Prompt,离普通人打开网页就能玩还有距离。 但它已经把推理代码和模型权重公开了。 这个方向终于不只是看一段官方 Demo,而是可以被下载、检查和验证 Alaya Lab
泊舟478,519 görüntüleme • 23 gün önce

熟悉我的朋友都知道,我一直在做coding场景的模型 API 中转站。 已经做了四五个月了,目前也已经有了一批用户。 我已经停滞增长了挺长时间了,所以我在想是不是我没有做市场调研?这个和几个月前市场是不是已经有了翻天覆地的变化? 下一阶段,我到底应该继续卷价格、增加模型,还是换一批更值得服务的用户? 这个问题听起来像行业调研,实际上离赚钱非常近。 因为中转站每多做一个功能、增加一条线路,背后都是成本。如果目标用户一开始就选错了,做得越快,可能亏得越快。 所以这次我做了一个对照实验。 我把完全相同的一段 Prompt,分别交给了 Codex 和 Atypica: 现在的模型中转站主要有哪些用户? 谁的需求最强、付费意愿最高? 用户除了价格还在意什么? 如果不卷低价,还能做什么差异化? 未来三个月应该怎么做产品和增长? Atypica 的官网在: ,感兴趣的朋友可以去尝试一下,注册无门槛送1M的token,足够你白嫖一次免费的分析。 两边最后都生成了一份完整报告。 但真正把两份报告放在一起之后,我发现它们最大的区别,并不是谁写得更长。 而是: Codex 告诉我应该验证什么,Atypica 则把“用户为什么会买”继续往下挖了一层。
泊舟67,070 görüntüleme • 4 gün önce

昨天我花了 30 分钟,做了一件如果放在以前,至少要花几万块的事。 我没写代码,也没发问卷,只想回答一个问题: AI 漫剧这个赛道,现在到底还能不能做? 真正做过商业研究的人都知道,一场深度访谈、一场焦点小组,再加一份完整的消费者洞察报告,预算动辄几万到几十万元,而且通常要等上几周。 如果研究海外市场,价格还得再翻几倍。 所以,大多数创业者最后得到的答案都是: 感觉还有机会。 但感觉,是创业里最贵的东西。 于是我把这个问题丢给了 Atypica。 它没有像普通 AI 一样直接输出分析,而是先反问我: 你准备做什么类型? 面向哪些用户? 希望验证什么? 最担心什么风险? 确认完这些问题,它才开始联网查资料、整理竞品、构建研究计划。 真正让我觉得有意思的是后面。 它生成了一组符合目标用户画像的 AI Persona,模拟真实用户做一对一深访,再把这些观点放进焦点小组里继续讨论。 也就是说,我不是在问一个 ChatGPT。 而是在采访几十个模拟目标用户。 这两个东西完全不是一个概念。 Atypica 官网: 注册会送 1M token,足够免费跑一次分析。 atypica.AI
泊舟111,786 görüntüleme • 25 gün önce

我之前横评了 4 个 PPT Skill,测的是谁能从零做出一份能直接拿去讲的 PPT。 这次我换了一个更像真实工作的测试:让 AI 接手上次的旧项目,直接往下改。 因为老板平时很少让你重新做一份 PPT,更常说的一句话是:把上次那版改一下。 麻烦也从这里开始。 上次到底是哪版,评分表放在哪里,结论有没有改,会议里又补了什么要求,最后还得沿用哪套模板。这些项目背景,通常比写提示词本身更费时间。 普通聊天工具只知道当前对话。每次开始新任务,你都得把旧 PPT、原始文章、评分表和修改要求重新上传,再花一轮时间解释整个项目。 所以我拿之前做过的 PPT Skills 横评项目,测试了一款叫 remio 的工具。 我给它的要求很短: 把我之前《PPT Skills 实测》的内容,改成一份 8 页、10 分钟的内部分享 PPT。保留 4 个工具的评分和结论,删掉安装过程,增加一页“不同需求怎么选”,输出可编辑的 PPTX。 它从已有资料里找出了当时的测试条件、4 个 Skill 的评分、各自优缺点和最终结论,然后重新组织成了一份 8 页 PPT。 93、77、72、58,原来的评分全部保留。 新增的“不同需求怎么选”也不是随便按总分排序,而是根据最终交付物来分:正式汇报选 ppt-master,网页演示选 html-ppt-skill,社媒传播选 guizang,需要中文模板再加工可以考虑 GordenPPTSkill。 生成结果是可以继续编辑的 PPTX。文字、图形和评分表都能在 PowerPoint 里直接修改,不是把整页做成一张图片塞进去。 我又补了一句:帮这份 PPT 配图。 remio 先读取了生图和编辑规范,再判断每一页还有多少留白。中间的表格和对比页信息已经很满,它没有继续塞图,只在封面和结尾页调用 GPT-5.4 Image 2 生成了 2K 插图,配色也沿用了原来的藏青、浅蓝和暖金。 最后出来的版本,既保留了原来的评分和判断,也补齐了内部分享需要的结构、选择建议和视觉元素。 这次测试让我觉得 remio 比较特别的地方,是它会持续建立个人知识库。 本地文件、网页、会议录音、邮件、日历和聊天记录,都可以进入同一套上下文。它还会为这些资料建立本地索引,需要处理任务时,不只看当前对话,也会从已经积累的项目资料里找信息。 所以这次做 PPT 时,它调用的不只是一条提示词。原文章讲了什么、4 个 Skill 怎么评分、哪些结论应该保留、最后要交付什么格式,这些信息都来自之前的真实资料。 很多 AI 可以根据一句话生成一套看起来不错的 PPT,但真实工作里更高频的任务,是在现有项目上继续修改。 你需要的是一个已经知道项目来龙去脉、可以直接接着干活的办公助手。 remio 的知识库数据保存在本地,也支持解析 docx、pptx、Excel、CSV 和 PDF 等常用办公文件。 除了改 PPT,它还能根据已有资料补 Excel 字段、整理数据、写公式,生成项目方案、周报和月报,也能把会议录音转成文字,再继续整理结论和行动项。 付费用户还可以通过 CLI 调用本地知识库,或者使用自己的 coding plan 和 API Key,把 remio 接进现有工作流。 我的理解很简单:资料先进入同一套上下文,Agent 再基于这些资料干活。 所以 remio 更像一个通晓项目资料的 AI 办公秘书。它知道文件在哪里、之前讨论过什么、现在要交付什么,然后帮你继续改 PPT、补数据、写报告。 如果你平时也要处理大量项目文档,可以去试一下:
泊舟47,579 görüntüleme • 10 gün önce

卧槽!这个网站简直是摸鱼神器,不知道是什么样的天才能想出来。 发现了一个非常牛的网站,专门用来生成游戏。我们只要输入一句话,它就能生成一个好玩的游戏,生成之后可以直接玩。游戏里的图片、素材、音效、场景,各种东西都能通过 AI 自动生成。 我直接让他生成另一个探索地牢、找钥匙的游戏,效果非常不错,还有史莱姆可以打,效果看视频,遇到打不过的,我可以直接修改关卡代码,金手指随便开 上班的时候,不用再玩那些已经玩腻了的无聊小游戏。直接自己创造一个游戏来玩,后面的关卡随时想、随时加,还能分享给同事一起玩。 人人都能成为游戏制作人的时代到了。
泊舟10,392 görüntüleme • 6 gün önce

谷歌推出了一个圣诞季的25天AI Agent的课程,我刚刚看了几节,发现不是给 Google Cloud的营销课。 其实是一个完整的学习路径,从最基础的Prompt工程到A2A协议,一直到企业级部署都有,每天解锁一个主题,现在已经第17天了
泊舟152,457 görüntüleme • 7 ay önce

这个视频是我用 ChatCut 剪出来的,没有加口播,主要是把自己原来用 Remotion 做视频的工作流迁了进去。 用下来最大的感受是,ChatCut 的完成度确实比我预期高。 最终效果比我自己用 Remotion 做得更好,整个制作过程也更丝滑。我猜他们应该针对视频制作场景专门优化了 Agent,或者选了更合适的模型,所以无论是设计风格还是审美,默认产出都比较在线。 它还把图片生成、音频生成、字幕、气口剪辑这些工具全都集成进去了。以前在本地要自己拼起来的一套工作流,现在基本都封装好了,做视频会省事很多。 当然也有两个取舍: 它是云端产品,不能完全在本地运行,在意隐私的人可能会有顾虑。 使用需要消耗积分,不过我还没有认真测过积分消耗,也不确定和本地跑 Remotion 相比,最终成本差多少。 总体来说,ChatCut 和本地 Remotion 都能做到差不多的结果,核心区别不是能不能做,而是要花多少时间折腾。 如果你喜欢自己掌控每个环节,Remotion 依然很合适。如果你更想图省事,ChatCut 已经把大量工具和工作流封装好了,整体体验确实会舒服很多。
泊舟23,530 görüntüleme • 27 gün önce

卧槽,我发现一个快速复刻抖音143万粉丝账号的方法 我在抖音上看到一个账号叫"快乐学英语",其实就是播放英文绘本,主要面向小孩子。比如其中一个《学会拒绝的小象》,单个视频就获得了54万点赞。 我研究了一下制作流程:先用提示词根据主题生成绘本故事,再生成分镜脚本,接着用 Nano Banana 生成主角图片和每个分镜的画面,然后生成视频,用 TTS 配音,最后把视频、音频、字幕剪辑组装起来。 听起来超级复杂对吧?但我用 Medeo,一条提示词就搞定了。 Medeo 最牛的地方在于它的多轮对话式交互——你就像在和一个懂视频制作的朋友聊天一样。我直接告诉它:"帮我创作一个关于小象学会拒绝的英文绘本视频,画风要温馨可爱,用亲和力强的女声配音。"它就开始干活了。 更厉害的是,Medeo 有长上下文记忆能力,整个创作过程中,我可以随时用自然语言调整细节。比如我觉得配音不够温柔,直接在对话框里说"换个更有亲和力的配音",它立刻就能帮我重新生成,而且会保持场景和人物的一致性——小象还是那只小象,背景还是那个背景,完全不会乱。 这就是 Medeo 的核心优势:多轮对话修改 + 角色场景一致 + 全流程记忆。你不需要重复描述角色长什么样,不需要担心前后不一致,更不需要在各种剪辑软件之间来回跳转。就像言出法随一样,想到什么改什么,让你真正专注于创作灵感,而不是被繁琐的技术细节困住。 下面是我生成的英语绘本视频,提示词在评论区,你也可以去试试 链接放在这里了:
泊舟123,868 görüntüleme • 7 ay önce

AI 写项目有个痛点,就是前端太容易、后端太难。说句话出一个页面,但一碰到建数据库、配用户登录、搞文件存储、管权限,普通人直接卡住。 InsForge 就是填这个坑的。YC S26 孵化,专门给 AI 编程智能体做后端的平台,Apache 2.0 开源,GitHub 9.7k star。 怎么接入?两种方式:1) MCP 服务,Claude Code、Cursor 这类工具直接连上就能用;2) CLI + Skills,命令行交互,不挑编辑器。 连上之后 AI 能自动搞定六件事:PostgreSQL 数据库建表迁移查、用户认证邮箱注册 OAuth 登录权限管理、S3 文件存储、Edge Functions Deno 边缘节点跑代码、AI 网关一个接口调多个大模型、一键部署写完直接上线。 上手简单。Docker Compose 一行命令本地跑起来,或者一键部署到 Railway / Zeabur / Sealos。 以前 AI 只能帮你写前端代码,接上 InsForge 它就是能独立交付的全栈工程师了。
泊舟42,081 görüntüleme • 2 ay önce

我经常看一些英文技术文档,但因为英语不够好,加上专业名词晦涩难懂,读起来很吃力。 之前我一直用 NotebookLM 转成播客听,但它生成的中文播客有个致命问题:听起来很别扭,有时候中文用词也不准确。 最近发现扣子上线了 Skills 功能,我就想着试用它做一个“转播客”的工具。 操作方式也很简单,直接打开 扣子编程网站: 然后选择技能,在输入框里面说了一下我的需求 我会输入一个英文博客文章,你帮我做成一个两人的播客,两个主持人对谈探讨播客内容,目的是用通俗易懂的方式说清楚这个文章的内容,你要使用api生成语音做成一个播客 它很快就为我生成了一个 Skill。然后生成以后点击右上角的部署 接下来回到扣子编程页面,在对话框选择更多技能,就看到了我的skill 我用 Claude 的《Skills explained》文档测试了一下,效果出乎意料地好,讲得通俗易懂。比如: 说话人1:你就把 Skills 当成是 Claude 的专业训练手册。 说话人2:那它跟平时发的 Prompt 有啥不一样? 说话人1:Prompt 就像临时问“这个菜咋做”,Skills 就是把整个菜谱都存下来,下次直接照着做就行。 7 分钟听完,还真全懂了(效果看视频)。 关键是,制作这个 Skill 我一行代码没写,只是描述了需求,扣子就把“如何通俗易懂讲技术”这个方法论固化成了 Skill。 接下来,我只需要把英文博客粘贴进去,它就会: 自动设计双人对话节奏,像听真播客一样自然; 识别晦涩概念,用类比解释(比如菜谱、咖啡店); 保留技术准确性,但绝不堆砌术语。 现在我读每篇文档,几分钟就能吸收核心内容,每天能省出大量时间用于深度思考。 我觉得这才是 AI 该有的样子:不是把所有人拉到同一个平庸水平,而是把少数人的方法论,沉淀成人人可用的能力。 录了个实际效果视频,大家可以感受一下这种“自然度”和“通俗度”。推荐大家去试一下,用来做一些基础办公的 Skill 非常好使!
泊舟37,881 görüntüleme • 6 ay önce

千呼万唤始出来,Gemini 3终于出来了! 大胆预测一下,本月Gemini 3出来,11月排名可能新王登基。 我直接来测一下它的编程能力,教大家如何在Claude Code里接入Gemini 3。 1. 打开 2. 创建API Key,现在可以免费用,还有充值赠送20%的活动 3. 设置环境变量,我推荐用CC Switch,需要配置以下环境变量 "ANTHROPIC_AUTH_TOKEN": "sk-ai-v1-xxx", "ANTHROPIC_BASE_URL": " "CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC": "1", "ANTHROPIC_DEFAULT_HAIKU_MODEL": "google/gemini-2.5-flash-lite", "ANTHROPIC_DEFAULT_SONNET_MODEL": "google/gemini-3-pro-preview-free", "ANTHROPIC_DEFAULT_OPUS_MODEL": "google/gemini-3-pro-preview-free" 设置完重启Claude Code就能用了。 具体操作看视频 👇
泊舟41,402 görüntüleme • 8 ay önce

看了锤哥分享的那个龙虾导航站 Claw123,我特意去逛了一圈。 这站是真的牛。 它把养虾要用到的东西全整理到一个页面了。部署方案、Skill市场、模型切换、教程文档、支付工具,你能想到的基本都有。 以前这些东西散落在各种地方,现在一个网址全搞定,就是龙虾版的hao123。 我挨个板块点了一遍,录了个视频你们可以看看,内容确实比我想象的全。 我还在里面看到了一个羊毛网站,估计很多人没有听说过,就是国家超算互联网。 那边可以白嫖1000万Token,还可以用2核4G的机器来部署龙虾。 特别是还没用过小龙虾的朋友,这波羊毛真的建议去薅一下。零成本上手,先体验再说,不用自己掏钱买Token试错。 老玩家也可以去看看,光是那个5000多个Skill的聚合导航就值得收藏,找技能效率直接翻倍。 地址在评论区👇
泊舟25,052 görüntüleme • 4 ay önce

碎片时间想用手机看一下电脑上跑着的工作进度,装了三个工具:Tailscale、frp、ssh。 配好之后出了错,让 AI 帮忙排查,但每次都很搞心态。就跟机场 VPN出问题一样,好不容易挤出来的时间,全浪费在这些工具上了。 最近看到有人推 UU 远程,下载尝鲜了一下。扫码登录就能用,没多余配置。远控桌面、端口映射、终端都在,三个工具装一个就够了。 终端直连出乎意料地顺手——扫码登录自动连接,进终端不用等,直连。键盘有两套可以切换:手机键盘 + 专用电脑键盘,Control、Shift、Cmd这些按键都在。 命令行还是要手敲,但对话内容完全可以接 Typeless或者闪电说语音输入,切换流畅。 配合 Claude Code 的 agent模式,相当于有了多会话窗口,顺带绕过了终端不支持多会话这个限制。 端口映射也有,加一条规则把台式机端口映射到本地,以前配 frp才能做到的事,现在顺带解决了。 还有一个很重要的一点,他们发布至今两年以来一直都是免费的,这次刚用不久就看他们官号发2周年宣传视频,我还以为要宣布收费了,没想到并没有,反而说还会继续免费。 然后还曝光了之后会上线的一些有意思的功能,比如安卓屏幕共享,共享文件夹功能,都挺让我期待的!
泊舟14,742 görüntüleme • 2 ay önce

今天下午用remotion做的一个科普动画,讲解openclaw的工作流程,这是我的MVP版本,欢迎各位提提意见,后续优化到位以后会做个详细的踩坑教学
泊舟19,412 görüntüleme • 6 ay önce
