
Jason Zhu
@GoSailGlobal • 35,984 subscribers
Show In Public | SaaS 出海 | 克尔凯郭尔种草🌿 Skills hub:https://t.co/x1VU8wWNj1 博客:https://t.co/ajYYIXGqFg 🤝 合作DM:GoSail_AI 📮:[email protected] MCN:[email protected]
Shorts
Videos

做 AI 视频最容易忽略的一步,其实是先学会拆别人的片 reelbench-skills,上线两天 196 star,Apache 2.0 两个 skill 干两件事 video-shots 拉片:一条成片拆成逐镜头分析表,时长、景别、运镜、画面描述全在一张表里。切点和时长由 ffmpeg 量出来,模型只判断该它判断的四件事,14 道质量门逐条对账 video-sync 合成:画面一边,分镜信息一边,镜头一切信息跟着切,横版竖版各一套布局 最妙的是拉片报告是单文件交互页,内嵌播放器,播放时同步高亮镜头,点镜头就跳,离线双击能开 零 npm 依赖,零 API key,只要 node 和 ffmpeg Claude Code、Codex 一个脚本软链装好: git clone 仓库后运行 ./scripts/install.sh
Jason Zhu58,382 次观看 • 2 天前
0:33
Sensitive content
This media may contain sensitive content.

想学编剧、或者用AI写剧本的,这个知识库是降维打击 screenwriting-skills,392星,13个编剧skill 它不是随手拼的提示词。是从19本编剧圣经里一本本蒸馏出来的:菲尔德的电影剧本写作基础、麦基的故事和对白、救猫咪、埃格里的编剧的艺术,再加上契诃夫的全部剧作、小津安二郎的剧本当范本 它把编剧这门学科拆成一整套工作流,每个环节一个skill:选题立意、故事结构、人物冲突、对白、场景、格式,一直到行业和商业规则。而且不只讲美国那套,日本、韩国、法国的编剧方法都有专门的skill 正文是中文的,还专门拆了美国经典电影的案例和日本十位导演的方法论。有个总控skill带你从头走到尾,项目状态存在一个story bible文件里,换个会话也能接着写 做AI短剧、写故事的,这套值得收藏慢慢用
Jason Zhu71,686 次观看 • 5 天前

辛苦做了一个月的SEO基建被颠覆了 7月被阿里巴巴和 Tribe Capital 领投的 650 万美元种子轮融资的 之前我花了一个多月搭了一整套 SEO 监控、竞品数据抓取和社媒监听的基建,写脚本、调接口、洗数据,折腾得要死 结果用 AIsa 喂给 Agent,一条指令直接把中推圈最火的 三大 AI 中转站(傅盛的 EasyRouter、孙宇晨的 WorldClaw)底裤都扒干净了: 1️⃣ 流量与外链质量透视: 表面上自然搜索预估和外链数量是其他家的几十倍,但一扒发现外链极度脆弱,大多靠 TRON 生态的返佣和交叉推广撑着 EasyRouter 外链高度集中在各类 AI 导航站,主要靠傅盛本人的个人 IP 在 X、知乎和公众号带节奏 WorldClaw 则是典型的美系打法,走 X 的 KOL 矩阵 + Crypto 媒体公关稿,外链结构最均匀健康 2️⃣ 关键词与盲区机会: 品牌词大家都在霸榜,但一对比就发现:模型落地页、长尾 SEO 词的索引金矿,几家头部几乎都没做深,这就是后来者的切入机会。 3️⃣ 社媒与渠道分发路径: 谁在 Reddit 潜伏、谁在 LinuxDo/V2EX 靠技术搬运、谁靠 Telegram 频道私域裂变、哪个币圈 KOL 拿钱发了推……全路径清清楚楚 不用再四处拼凑 Ahrefs/Similarweb 和社媒爬虫 它把 SEO 审计、竞品分析、GEO 可见性和 KOL 监听全部打包成了开箱即用的只读 Skill 注册还送 $1 额度,直接挂给你的 Agent 就能跑出整套 GTM 报告 🔗
Jason Zhu93,748 次观看 • 18 天前

做 App 的人最怕的从来是这句话:功能都做完了,怎么收钱? 海明Dev 刚开源的 haiming-app-monetization,2 天 168 star 一个专门管 App 商业化的 Skill:读你的项目代码,去查同类产品的真实定价,然后给出 onboarding、付费墙、套餐方案,直接能交给开发 Agent 落地 最妙的是它很诚实 默认只评估不改代码,查不到价格就标"未核实",AI 类 App 有持续成本它就不推无限终身,验收文档里明确写了不承诺转化率 这种克制反而比吹得天花乱坠的靠谱!! Claude Code、Codex、Cursor 这类支持 Skill 的 Agent 都能用,一行装上: npx skills add HammingDev/haiming-app-monetization
Jason Zhu15,133 次观看 • 3 天前

Stanford CS336 上,Tatsu 讲了一节 LLM 架构课,把过去 3 年所有主流 LLM 拆开,看它们的共通模板 结论挺爆:90% 的架构选择已经收敛,你随便挑一个开源大模型,它跟其他模型在这些维度上几乎一模一样 讲师的原话 - 2024 年大家都在 cosplay Llama2 - 2025 年的主题是「怎么训得不崩」 - 2026 年的主题是「怎么扛住长上下文」 下面是 2026 年开源 LLM 的标准模板 你训自己的模型可以直接抄 【架构层 已经收敛的 7 件事】 1)Layer Norm 挪出残差流(pre-norm) 原版 Transformer 把 LN 放在残差里 几乎所有现代模型都挪到外面 原因:keep your residual stream clean 梯度反传更稳 2)RMS Norm 替代 LayerNorm LayerNorm 的减均值 + 加 bias 那部分实际没怎么帮上忙 丢掉之后 flops 只省 0.17% 但运行时省到 25% (瓶颈在数据搬运 计算反而次要) 3)所有 bias 项全删 跟 RMS Norm 一个道理 系统层省内存搬运 4)激活函数用 SwiGLU 或 GeGLU gated linear unit 几乎所有现代模型都用 Llama 系 / Qwen / Mistral 用 SwiGLU Google 系(Gemma / T5)用 GeGLU 区别极小 选哪个都行 5)位置编码用 RoPE 2024 年之后基本统一了 原理:把每对维度按位置旋转一个角度 让 inner product 只依赖相对位置 6)Transformer block 串联(不是并联) GPT-J / Palm 试过并联 现在基本被放弃 串联的实现优化得太好了 并联省的那点系统开销不值得损失表达力 7)Layer norm 可以「撒」 哪儿不稳就在哪儿加 LN attention 之前能加 之后能加 两边都加(double norm)也可以 现代模型很多这样做 【超参数 已经收敛的 5 个数】 1)feedforward 维度 / hidden 维度 - 非 GLU 模型:4 倍 - GLU 模型:8/3 ≈ 2.67 倍(因为 GLU 多一组矩阵 要保持总参数量) - Llama 系:3.5 倍 - T5 1.0 试过 64 倍 后来 T5 1.1 改回标准 别学 2)head 数 × head 维度 ≈ hidden 维度 几乎所有模型都遵守 T5 是为数不多的例外 3)模型纵横比(hidden / 层数)≈ 100 太深 pipeline parallel 难做 太宽 表达力受限 100 这个数字是系统约束 + 表达力的平衡点 4)vocab size 单语模型:30K 左右(早期 GPT-2 那种) 多语 / 通用模型:100K-200K(GPT-4 / Llama 3 / Gemma 都在这个范围) 现代基本都是后者 5)weight decay 仍然普遍使用 但研究发现它在 LLM 里干的事其实是优化器干预 让你最终能收敛到更深的最优点 跟你想的「防过拟合」没什么关系 所以别因为「单 epoch 不会过拟合」就把它关掉 【稳定性 三个救命 trick】 训练大模型最怕中途 loss 突然飙升 然后 NaN 全军覆没 现代模型用三个 trick 防这件事 1)Z-loss output softmax 的 normalizer 容易爆 加一个 (log Z)² 的正则项 让 Z 始终接近 1 DCLM / Olmo 都用 2)QK norm attention 的 Q 和 K 在矩阵乘之前各加一个 LN 让 softmax 的输入永远是单位尺度 multimodal 圈先用起来 现在所有大模型都加 3)Logit soft cap(仅 Google 系) attention logit 用 tanh 硬封顶 Gemma 2/3/4 都在用 但会损失一点点性能 慎用 【Attention 两个新趋势】 1)GQA(Grouped Query Attention)几乎统一 原版 multi-head 推理时 KV cache 会让算术强度崩到 1/h GQA 共享 K 和 V 但保留多个 Q 表达力几乎不损失 推理成本砍掉 80% 现在所有要做生产部署的大模型 没有不用 GQA 的 2)局部 + 全局 attention 交替 处理长上下文的新方式 Cohere Command A 起头 现在 Llama 4 / Gemma 4 / Olmo 3 全在用 比如每 4 层有 1 层 full attention 其他 3 层是 sliding window 只看附近的 token 比纯 SSM 更稳 比纯 full attention 便宜得多 (Qwen 3.5 做了变体 把 sliding window 那 3 层换成 SSM) 收尾一句 如果你正在训自己的 LLM,上面这一套就是 2026 年的「默认配置」 不需要重新发明,直接抄 如果你只是想看懂 GitHub 上那些 modeling_xxx.py 这一份足够你不再被术语吓住
Jason Zhu542,518 次观看 • 4 个月前

判断一家传播公司靠不靠谱,看复购比看浏览量准 12 个复盘案例里有 3 个是品牌方回头下的单: · 某 API 中转站 4 轮 · 某自迭代 Agent 3 轮 · 某模型服务平台 2 轮 一次爆量可能是运气,第四次下单不是 GoSail Labs 案例集: 1️⃣ 传播圈很少有人提的一件事:好内容会自己长。 某 AI 模型服务平台的案例,首轮内容发出去之后没再管,5 个月后回头看,浏览量涨了 141%。 15 帖现值累计 56w+。 投放停了,内容还在working。这才是内容资产和买量的区别。 2️⃣ 把 GoSail Lab 的推特案例摊开讲: · 12 个复盘案例,累计 1037w+ 浏览 · 单条最高 41.8w · 最大一次 55 位中英文创作者双线并行,中文圈和海外同步打透 每个案例都拆到项目背景、执行结构、内容样本、数据结果四层 3️⃣ 某世界模型的案例:50 位创作者,两天集中发布,累计浏览 125w+,覆盖粉丝约 81 万 做集中爆发的前提不是人多,是提前把内容方向分好——谁讲技术、谁讲场景、谁讲对比。 不然 50 个人发出来是 50 条重复的。 感谢大家信任 GoSail Labs,精选案例总浏览破1000w!
Jason Zhu17,224 次观看 • 5 天前

过年那段时间和 Neo Reid(AgentReach 作者 Neo)聊天,他给我演示了他怎么用龙虾 OpenClaw 最骚的是他演示的姿势:人在咖啡厅,掏出手机,远程操控他家里那台 PC 跑 OpenClaw 整个过程我看呆了 不是因为 OpenClaw 多强(它确实强),是因为他手机端的操控丝滑到我以为是在本地操作:4K 画面、144 帧、几乎零延迟,还能直接调出远程终端看 agent 跑到哪一步 我问他用的什么远控。他说:UU远程 没想到之前折腾的各种方案(免费的不丝滑、付费的限速)全部都是在凑合,回家立刻装了,用到了现在 说说我搬过去之后的真实工作流: 🔥 核心是 手机端远控电脑 + UU远程的终端功能 我家里那台 24h 在线的老macbook pro上挂着 Claude Code + OpenClaw + agent loop 出门时打开 UU远程 App → 手机里直接进远程命令行入口(不用配 SSH、不用挂穿透) → tmux attach → agent 跑到哪一步、reward 曲线、GPU 利用率,全在手机上看 用下来体感最特别的一点:流量真的省。我经常在地铁上挂 1G 流量包用一上午,等于把"看 agent 跑到哪了"这件事的成本压到接近 0 真要动手改代码的时候,iPad + 蓝牙键盘 / 手机 + UU远程的 4K 桌面远控顶上去,延迟低到我经常忘了不是本地 多屏协作把家里两块屏分别拖到 iPad 上更舒服 一开始我以为这种体验肯定要开会员。装完用了两天后翻了一下设置,发现没找到付费入口,不绑会员、不限画质、不限速、没广告弹窗。后来才知道是网易出品的,安全那边也过了 ISO 27001 + 27701 双认证。 我自己用得最顺手的两个小功能: - 一键远程开机:家里 PC 平时不用开着,出门前忘了启动也没事,要用的时候手机点一下唤醒; - 被控端一键防窥黑屏:咖啡厅里远控的时候,家里那块屏自动黑掉静音,路过的人看不到内容。 最近产品两周年周年庆的时候,预告了一个功能,叫共享文件夹,应该是能在控制端显示被控端的本地磁盘,对Vibe Coding的效率肯定会有明显提升。 如果你也在搭家里那套 always-on AI 工作机,这是 Neo 给我打开新世界的工具,原原本本传给你
Jason Zhu204,804 次观看 • 3 个月前

最近爆火的OpenRouter 上冒出一个匿名模型 Ox Alpha(GLM),其实管道不会撒谎,会撒谎的是人 Crawl4AI的作者unclecode这句话,道破了怎么验一个API背后到底是哪家的模型 厂商在别名后面偷偷换模型,不会告诉你。他两天前就发现DeepSeek的deepseek-chat这个老名字下,悄悄换成了另一个模型 他的思路是不听模型自己说,只看基础设施的指纹,九个探针: 01|喂英文全字母句、中文段落、代码、emoji,只数prompt_tokens。分词器是每家自己训的,中文分词差异最大,藏不住 02|temperature设成2.0,看报错原文逐字。那句话是这家工程师亲手写的 03|GLM的1301错误码、finish_reason的词表、上下文天花板是1048576还是262144,每一项都能定位到具体厂商和变体 前几天OpenRouter上那个匿名模型Ox Alpha,全网都在猜。modelprint一测,分词器四项归一化计数全中,直接指向GLM家,其它厂商最好也只中一半 纯前端无后端,API key只留在你自己的浏览器标签页,不经过任何服务器
Jason Zhu45,255 次观看 • 23 天前

DeepSeek 像一把抵在硅谷模型公司背后的枪 🔫 硅谷101 今天上线了一期炸裂对谈:OpenAI 前研究员 Jenny Xiao × 芯片架构师肖志斌,两个硅谷内部人聊 DeepSeek v4 带来的生存危机 刚好也看到国内比较喜欢的AI博主大聪明“赛博禅心”,在解读这个视频,直播中的两个嘉宾很有料: - 肖志斌:ZFLOW AI 创始人兼 CEO,前华美半导体协会主席,资深芯片架构师 - Jenny Xiao:前 OpenAI 研究员,Leonis Capital 合伙人,专注 AI 投资 I've heard a similar point on an A16z podcast before, and it seems like reality has proven it right again. Marc Andreessen 🇺🇸 Justine Moore Olivia Moore 最狠的三句话: 1️⃣ "If you're a foundation model company and you get surpassed by open source, the value of your business is essentially zero." 这不是技术竞争,这是生死线(kill line) 2️⃣ "硅谷公司钱太多,反而没动力优化效率。中国模型厂商被资源倒逼,更早进入 token efficiency 创新",资源约束 = 创新加速器 3️⃣ "没有效率,AGI 就只能是个 demo。有了效率,AGI 才能成为真正的产品" ,DeepSeek v4:计算成本 1/3,内存占用 1/10 核心观点 - Anthropic 估值超过 OpenAI 的真相:专注 > 什么都做 - GPT-5.5 比 GPT-5 贵 2 倍,DeepSeek v4 便宜 10 倍,谁在裸泳? - 英伟达短期安全,长期推理市场会被 TPU / 升腾 / 寒武纪瓜分 - Claude Code 为什么是 Anthropic 的定义时刻 完整对谈👇
Jason Zhu225,277 次观看 • 4 个月前

昨天我们 launch 了 Ship2Market,聊聊为什么做这件事 去年我上线过一个小产品,一个菜谱网站 逻辑很简单,你输入手上的食材,比如土豆、午餐肉,再选下厨具,它就给你出菜谱 我还挺上头,加了中式的、西式的,做了不少原创优化,全栈一个人吭哧吭哧干了一个月 结果上线之后,没人来 那一个月我真正学到的东西,和写代码无关: 产品做得再用心,没人知道,就等于白做 营销这一关,比我想象中难太多,也重要太多 Ship2Market 这名字,是从 Marc Lou Marc Lou 那儿得来的灵感 他有套口号叫 Build,Ship,Earn Build 是你把产品做出来,Ship 是你把它发出去,Earn 是产品真踩中了市场,用户自然愿意掏钱 我发现,大多数独立开发者卡住的,恰恰是后面两步 所以 Ship2Market 想接手的就是这两件事:帮你把产品推向市场,让它去接受真实用户的检验 只要东西够好,流量和收入会自己找上门 还有个关于 logo 的小插曲 第一版是个小机器人头像,但总觉得少了点「ship」的劲儿 后来我们加了宇航员面罩,配了个小火箭,一下就对了 我合伙人盯着看了会儿说,你这好像在故意突出那个「2」 我们一想,还真是 帮独立开发者做市场验证这事,说实话并不赚钱,是有点「二」 但我们就想干这件二事 我们想帮的,就是那些有好产品、有想法,却没有营销预算、也不太会 go to market 的人 让他们的东西,尽快被市场看见、被验证 你负责产品,我们负责出海 🔗
Jason Zhu65,174 次观看 • 1 个月前

你不用手写AGENTS.md了,你用梯度下降训练它 这个脑洞我服了。backpass把你的AGENTS.md当成神经网络的权重 每跑一次agent会话就是一次前向传播,留在硬盘上的transcript就是损失信号。可这个信号以前没人读,全靠你哪天想起某次失败,手动去改文件 backpass把这个闭环接上了:自动找到你仓库里真跑过的agent会话,读懂里面发生了什么,反向提出有证据支撑的改动,等于给你的记忆文件做一次梯度下降 每条改动都附带真实会话里的原话,一条新规则至少要两次独立会话佐证,一次最多改五条。全程只有你点了apply它才会写 纯本地,直接读七种agent的会话记录,什么都不上传,MIT开源
Jason Zhu32,221 次观看 • 21 天前

昨晚刷到的抖音视频 和我之前的经历很相似,其实当时考研只是为了想去电网上班,因为之前在供电所帮忙,感觉他们很惬意,早9晚5,中间还能休息好几个小时 读研完后去互联网公司,其实也没有改变想法,直到我出来后探索了很久才懂得视频里说的两句话: 1️⃣ 看到有风险的东西你不敢碰,但是你没有看到风险背后的利益; 2️⃣ 看到有利益的东西你就想碰,但你没有看到利益背后的风险。 最近有国企的研究生同学问我一些事情,说想辞职,工资太低了 我问他想好没出来后要做啥,他说我看你做的不错,能不能和你学,我一下子不知道怎么回复 当习惯了确定性的时候,不确定性是你所恐惧的
Jason Zhu205,505 次观看 • 5 个月前

用自然语言做游戏到底能做到多细? 我直接跟 Gear Zero 的 AI 智能体“吵”了 8 轮,把一个叫《扫地僧》的小游戏给硬生生磨出来了: 从最开始扫院子落叶的简单原型,到后来我提要求:“扫帚要有弧形风痕手感”、“加一本往事收集册”、“院子里要加个会走动扫地的小师弟”、“墙角的叶子扫不到给我加微吸附”…… 每一次修改它都真的理解并重构关卡代码,最后做出来的版本连收集印章和合页剧情都有了。 做好之后丢个链接给朋友,手机/电脑浏览器/微信内点开就能玩,我的游戏链接: 想把脑子里的游戏脑洞变现的,强烈建议去体验下: 🔗 #GearZero #AIGame #无代码开发 #独立游戏
Jason Zhu27,124 次观看 • 19 天前