Загрузка видео...

Не удалось загрузить видео

На главную

什么 DeepSeek 可以支持多模态了? 其实是曲线救国! 最近 DeepSeek V4 Flash 正式版发布,Pi 突然在推特中文区火了起来,看到不少人开始发教程。 Pi + DeepSeek V4 Flash 用起来是真的又爽又快对吧?但是唯一的遗憾就是不支持多模态。 这里我就分享一个我自己 Vibe 的 Pi extension pi-vlm-proxy :支持自动配置其他多模态模型,自动识别当前model是否是 text only 从而调用其他多模态模型识别图片、视频并且返回结果。 快速安装:pi install npm:pi-vlm-proxy 评论区看 Github 链接:

44,412 просмотров • 1 месяц назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

Harry 是我的好朋友,他一直以来展示踏实靠谱的性格特征,持续的构建 Everlyn: 中心化的AI 视频模型 一开始 Everlyn 在开发阶段,目前使用 Everlyn-1.5 模型已经可以顺畅生成各种视频。 这值得令人兴奋,因为在Web3 领域终于诞生了用户可用的 AI 产品 这次不是概念,而是真实可以用的产品 而且相比于其他模型, Everlyn 的生成速度是其他模型的2-4倍,费用也比其他模型低 花费10美元的情况下,Everlyn (Pro) 可以生成125段视频,Kling 2 Master 只能生存 20 段 Everlyn 是类似社区节点的 Lyn miners(矿工) 进行去中心化的运营,过去一周内就已经有了1w名付费用户,一周内的收入也有 140,000 代币 TGE 之后 Lyn miners 将有更多参与网络发展的方式 视频生成领域的市场规模是足够大的, Sara2.0 也印证了这一点, Everlyn 大概率不会上演 TGE 之后协议空无一人的情况 因为 Everlyn 也从未承诺过视频用户会获得什么,而是社区用户自主为 Everlyn 付费,这是正确且健康的模式 代币的代码是: $LYN 15:00 将在 Binance Alpha 上线 15:30 在 Binance 合约 上线 团队的学术背景很强, Haryy 本来就是视频领域的专家,核心顾问的 Yann LeCun 还是图灵奖的获得者 项目由 Yzi Labs 孵化,完成了 1500 万融资,大家可以在 Binance Alpha 阶段订阅一下 其他视频模型在初创阶段就能获得亿元融资,Everlyn 在当前和未来的发展中应当展现的市值是多少呢? 相信 Everlyn 很快将推出下一代更真实,更便捷的模型

Vand Ni|Asian bro

20,182 просмотров • 11 месяцев назад

刚看完 SemiAnalysis 这篇 DeepSeek V4 推理性能长文,很有意思。 DeepSeek V4 一出来,被考试的是 NVIDIA、AMD、Huawei、vLLM、SGLang、TensorRT-LLM、ROCm、CANN 这一整套推理生态。 省流一下 SemiAnalysis 这篇的几个核心点: 1/ CUDA + vLLM / SGLang 仍然是 Day 0 最稳的生态。DeepSeek V4 Pro 发布当天,CUDA 平台上的 vLLM 和 SGLang 基本能直接跑,B200/B300 这类新 SKU 的 recipe 也大多开箱可用。 vLLM 和 SGLang 这两个开源推理引擎,已经是全球 ML 基础设施的核心组件了,各自独立出来成了公司(Inferact 和 RadixArk),融了几亿美金。他们的生态优势在这时候体现得最明显:新模型一出,开源生态能在第一时间接住。 2/ AMD 一开始很狼狈。MI355X Day 0 只能跑 FP8,交互性低到 1-2 tokens/user/sec,SemiAnalysis 直接说这不是生产可用状态。不过后面 AMD SGLang 团队 26 天内把性能拉了 100x 以上,这个追赶速度也很夸张。 3/ TensorRT-LLM 反而翻车了。他们有个 kernel 把 DeepSeek 的 hidden size 写死了 4096,这个问题拖了一周多才被注意到,SemiAnalysis 后来自己提 PR 修掉。 4/ Huawei Ascend 这次是另一条主线。华为 Ascend 950DT,在 DeepSeek V4 发布当天就提供了推理支持。CANN 发了优化指南和 benchmark 数据,也展示了从 kernel、graph path、quantization 到 serving / deployment recipe 的 full-stack 思路。 SemiAnalysis 的判断很明确:DeepSeek V4 的 Day 0 支持栈里,真正接住的只有两个,NVIDIA CUDA 和 Huawei CANN。 5/ GB300 NVL72 的 rack-scale 优势非常明显。SemiAnalysis 给的测算里,GB300 在 MTP 打开后几乎统治所有 interactivity level,50 tok/s/user、8k input、1k output 假设下,output token 成本可以到 $0.156 / million。 总结一下我的观感。 DeepSeek V4 的发布,本质上是一次对整个推理生态的年度统考。CUDA 生态依然最强,但华为的 Day 0 支持证明了 CANN 栈的成熟度正在快速提升。AMD 能在 26 天内追 100 倍,说明工程能力没问题,但 Day 0 的差距暴露了 ROCm 生态的脆弱。 TensorRT-LLM 的翻车,和 vLLM/SGLang 开箱即用的对比,可能是这篇文章最值得玩味的细节。闭源引擎的优化上限可能更高,但在 Day 0 这个时间窗口里,开源生态的响应速度是不可替代的。 问题变成了:当中国最好的开源模型之一(DeepSeek),遇上中国最好的 AI 芯片软件栈(CANN),这种 co-design 的优势会持续多久?NVIDIA 的护城河到底在硬件还是在软件? 感觉这个问题,可能比模型本身的参数量重要得多。

AI Dance

18,680 просмотров • 3 месяцев назад

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

17,513 просмотров • 2 месяцев назад

最近一段时间都在关注模型、建模、仿真、优化 这些都是有趣课题,值得去了解学习 在这里我简单介绍两款开源项目: Webots 和 Modelica & OpenModelica 视频1是Webots的自动驾驶仿真 视频2是OpenModelica 6气缸的 v6 引擎仿真 模型,模拟仿真,物理引擎,机器人,自动驾驶,都是非常重要的课题和基础 Webots 是一款用于模拟机器人的开源多平台桌面应用程序 之前也提及:汽车自动驾驶其实就是一个大号机器人,软件定义汽车已是趋势 Webots 提供了一个完整的开发环境来建模、编程和模拟机器人 它为专业用途而设计,广泛应用于工业、教育和研究 Webots 基于 C++/Qt 构建,支持 ROS Webots 依靠 ODE(Open Dynamics Engine,开放动力学引擎)进行物理模拟 因此,一些 Webots 参数、结构或概念引用了 ODE ODE 有着广泛的应用,值得更多关注 Webots + ODE + ROS 一个完整的机器人自动驾驶模拟仿真工具链 一个思考:我们的世界是个建模仿真还是一个真实存在 -------------- 建模很重要 Model knowledge is stored in books and human minds which computers cannot access 数值分析、科学计算软件包基本都会搭载建模仿真工具,比如 MATLAB 有 Simulink Scilab 有 Xcos 当然,也有很多专注建模和仿真的开源工具,上面介绍的 Webots,接着再给大家介绍下 Modelica & OpenModelica Modelica 是开源建模语言 OpenModelica 是一个基于 Modelica 的开源建模和仿真环境 (基于 C/C++/Qt 构建),包含编译器和运行时,旨在供工业和学术用途 基于建模语言和仿真环境去学习研究和实践数学建模、物理模拟和科学工程都是非常好的方式 类似将 MATLAB/Octave/Scilab 用于数值分析和科学计算是同样道理 Modelica 基本理念: 设计一种建模语言,满足多领域物理系统建模与仿真工程应用,可用于几乎所有工程领域的建模,从而摆脱针对特定专业领域工具的限制 换言之,Modelica 即是建模语言,同时也是模型交换与重用的标准 众多面向对象建模语言开发商共同一起,基于他们的经验,研究建立多领域物理系统的建模规范 Modelica 可以解决用连续微分代数方程组(DAEs)表示的许多问题 Modelica 使用 DAEs,而避免使用常微分方程 (ODEs) 描述物理世界,从而在建立方程方面减轻了建模人员的负担 Modelica 支持连续变量和离散变量两种方式在同一组件模型或系统模型中使用 Modelica 模型标准库,Modelica Standard Library, MSL 开发 MSL 的目的是让使用 Modelica 语言的用户,不用开发底层基本的组件模型,就可以开展物理系统的建模和仿真工作 用户需要掌握 Modelica 语言的基础,并学会怎样有效地使用 MSL 目前版本的 MSL 包含 1417 component models and blocks, 512 example models, and 1219 functions Modelica 是开源建模语言,采用类似 C++ 的发展模式,希望能最终纳入 ISO, ANSI, IEEE 标准体系 如果不出意外,Modelica 极有可能会像 C++ 一样成为一种流行的物理系统建模语言,我们拭目以待吧 有关 Modelica & OpenModelica 的介绍和快速了解,可下载官方提供的 200 多页幻灯片资料 从 1997 年 1.0 版到现在正在开发的 3.7 版,Modelica 建模语言之路也已走了快 30年 ---------------------- ps: 国内外的很多差距其实就体现在这些方面,国外很多研究和应用可以一直持续几十年不间断。(展开,包括很多知名摇滚重金属乐队,动不动就是30,40年历史,国内乐队大多昙花一现,有些东西确实没办法) 我们更多是热点来了一哄而上,热度退却,再一哄而散。没有10年,几十年甚至上百年的积累沉淀,怎么比和竞争呢 所以不要盲目的瞎高潮,克制住站在巨人肩上取得一点进展的狂喜中迷失自我

灰狐

13,010 просмотров • 1 год назад

从产品视角看 白 + 支付结算 + 隐私”做成一条更短的路径 孙哥参与顾问的项目 白 让用户/开发者/未来的智能体,用统一入口与统一结算方式,低摩擦地调用顶尖模型与算力,同时尽可能减少传统支付体系带来的行为画像与围墙效应。 1)用户痛点到底是什么?不是“没有模型”,是“调用这件事太碎” 如果你是普通用户或轻量创作者,你会遇到这种体验问题: • 想用不同模型完成不同任务:写作一个、代码一个、图片一个、推理一个 • 但每家要注册、订阅、绑定支付、切换账号 • 一旦涉及支付,信息链路和行为沉淀很重(隐私敏感的人会非常在意) 如果你是开发者/团队,痛点会更硬: • 多家模型不同 API、不同限速、不同计费、不同账单 • 采购与对账像在做供应链 • 模型迭代很快,接入层维护成本越来越高 • 更现实的一点:跨区域支付/风控/合规流程会直接卡进度 而当你开始做 Agent,痛点会升级成“结构性问题”: • Agent 要按任务动态选模型、选算力 • Agent 需要“自己付钱买资源”,才能持续运行 • 没有支付与结算能力,Agent 很容易停在 demo(靠人工续费/人工维护) 2)白 把产品拆成三层:入口、路由、支付网络 白 的产品设计不是单点功能堆叠,而是三层结构,对应三类用户与未来演进: (1)To C:BAIclaw(白虾助手)——多模型交互入口,主打隐私体验 这是面向普通用户的入口层:把多模态与多模型聚合到一个交互端,并把“隐私保护”放在主叙事上。 从产品价值来说,它解决的是“想用最合适的模型,但不想在一堆平台之间迁移和暴露信息”的需求。 一个很直观的对比案例: 你在传统平台用信用卡订阅/计费时,支付链路天然会把“你是谁、你在哪、你买了什么、你多久用一次、你偏好什么能力”沉淀成画像;而 白 主推的路径是钱包地址登录 + 链上支付,尽量把这条“支付—身份—行为”的绑定关系拆开,让隐私敏感用户在使用多模型时不必默认交出完整画像。 这也是孙哥特别推的一点:匿名与隐私不是噱头,而是 Agent 时代的生产要素——谁控制了调用与支付数据,谁就控制了未来的分发与定价权。 (2)To B:LLM 顶尖大模型聚合路由——开发者默认网关 对开发者来说,白 的关键点是“路由”而不是“模型”。 它提供统一 API,把多模型接入变成一种更工程化的能力: • 不用逐家谈采购、逐家接 SDK • 不用自己维护复杂的切换与策略 • 让产品团队能把资源花在体验与场景,而不是胶水工程 你可以把它理解为:多模型时代的“接入层与调度层”。 (3)To Agent:AI 智能体链上支付网络——让智能体拥有身份与支付能力 白 提到的双协议(x402 / ERC-8004)对应两个核心能力: • ERC-8004:链上身份(让 Agent 可被识别、授权、计量) • x402:无摩擦支付(让支付成为可编程能力) 它想解决的是:当 Agent 开始自主运行时,支付/结算不应继续依赖“人类账号 + 信用卡 + 平台风控”这套体系。 这里也可以用一个更“可感知”的案例来理解: 假设一个 Agent 需要和另外 5 个 Agent 协作完成任务(A2A),并且按贡献实时分账:传统体系下你很难做到“秒级微结算 + 自动对账 + 可验证历史”;而依托 x402 与 ERC-8004,交易与交互历史可以沉淀为可验证的信任基础,逐步形成“Agent 社会”的信用体系,使得真正去中心化的 A2A 协作与微结算成为可能。 更重要的是,一旦这条支付网络已经支持多链、支持主流加密币种的支付,那对 Agent 来说就不是“能不能付”的问题,而是“付得足够快、足够低摩擦、可跨生态”的问题——这会直接决定 Agent 商业闭环能不能跑起来。 3)它解决的问题可以总结成一句产品话术:把路径缩短 站在产品角度,白 做的是把链路变短: 以前: 多平台注册/订阅 → 各自绑定支付 → 调用留痕与画像 → 多模型维护与对账 现在(白 叙事): 钱包登录 + 链上支付 → 统一调用与路由 → 清算网络支撑结算 → 更少网关壁垒 这里要注意它的 PR 边界:白 并不把自己描述成“代理/中转站”,而是强调智能路由、算力聚合、底层基建、隐私保护、无边界访问——也就是把自己放在基础设施位置,而不是工具拼装位置。 4)对标怎么说才专业:体验上像 OpenRouter,但差异点在隐私与支付闭环 如果非要找一个“体验层”的参照,白 在 To C/To B 的使用路径上,确实会让人联想到“多模型聚合平台”(比如 OpenRouter 的那类思路)。 但 白 想强调的差异不是“模型更多”,而是两点: 1)隐私叙事更强:通过链上支付,尽量切断传统支付体系的信息收集闭环 2)更偏 Agent 经济化:不仅是聚合调用,还要把身份与支付/清算做成底层网络,让 Agent 能自主购买算力并形成商业循环 这也是为什么它避免和 OpenAI/Anthropic 直接竞争——它的野心不在模型层,而在“让模型与 Agent 可持续运行”的底层能力。 5)适合谁用:三类用户一眼就能对号入座 普通用户/创作者: 想要一个入口随时切模型,同时更在意隐私与支付痕迹的人。 开发者/产品团队: 想降低多模型接入维护成本,尤其是需要动态路由、统一结算、快速迭代的团队。 Agent 构建者: 目标是让 Agent 真正自主运行(能付费、能对账、能闭环),而不是停留在演示。 6)为什么说孙哥这步布局“格局高”:再创业不是换赛道,是把赌注押在底座 孙哥作为 白 顾问,我觉得这里最打动人的点,反而不是“站台”,而是他身上那种典型的 AI 赛道创业者气质:看得更远,也更愿意做难事。 很多人会选择在应用层追热点、做流量型产品;孙哥更像是在“第二次创业/再出发”时,把筹码压在下一阶段的必需件上——当 Agent 从“会对话”走向“会协作、会交易、会自我运转”,身份、支付、清算、路由会从可选项变成基础配置。 这种选择不一定最热闹,但一旦趋势兑现,基础设施的生态位会更稳、更厚。能在大家都追短期叙事的时候,去推动“匿名与隐私保护”以及“Agent 经济化 H.E. Justin Sun 👨‍🚀 🌞 B.AI #TRONECOStar

MEJ毛毛姐

26,160 просмотров • 5 месяцев назад