字节跳动刚刚开源了那个控制你整个电脑的代理。 100% 本地运行。只看像素。没有外部 API。没有任何东西离开你的机器。 它叫 UI-TARS Desktop。36.4k 星标。Apache-2.0。 它与... show more

币世王 🦅
12,875 次观看 • 3 个月前
有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者... show more

DeFi狙击手 | Ai🕊️
17,513 次观看 • 2 个月前
前两天用了ChatCut我以为它已经很牛了至少在某些程度上能替代剪映,没想到今天部署的这个开源项目OpenMontage更厉害,只需要接入大模型它就能直接帮你写好提示词分镜脚本,有哪里不对的还可以让它改,我刚就说了一句“帮我生成一个15秒的猫和老鼠的视频”,它就给我做了一个这样的视频出来,自从有了AI各行业的压力是越来越大了,以后动画设计那些我感觉越来越多人要失业了。

科技俊 | Tech Jun
35,059 次观看 • 2 个月前
深圳有个22岁的学生,用一部900块的红米手机。 就三月份这一个月,这部手机帮他赚了14700美元。他爸妈到现在还以为他在备考。 手机每隔半小时,自动打开六个中文新闻App。自动翻看新闻标题,截屏,然后把摘要扔给Claude。 AI再把这些新闻和Polymarket上的价格做对比,给出投注建议。 Polymarket→ 整个过程,这个学生一行代码都没写。 靠的是一个开源项目叫PhoneDriver。 原理很简单:AI像人一样看手机屏幕,自己判断要点哪、滑到哪。 你只要用大白话把任务描述清楚就行。... show more

TGweb3
54,700 次观看 • 5 个月前
发现一个能把任何电子书变成Claude Code skill的项目,叫 book-to-skill 解决了看书的痛点:你买了本实用的技术书,认真读完,三个月后就忘了讲了什么。 这个项目把整本书变成Claude Code随时能调用的skill,调用它再加上电子书路径,就能自动拆成核心总览、分章节笔记、术语表、速查表。 拆完后这个skill就会以书名命名,你只需要输入书名,它会给你整本书的核心总结 如果你带着具体问题问,它会自动去对应章节里找答案讲给你听。 而且这些章节都是按需加载的,你不问到的部分不会占用上下文。

阿西_出海
11,541 次观看 • 2 个月前
有人把 Claude Code、Codex、Kimi 这些 AI 全塞进了一个桌面软件里,叫 hermes-desktop。 不用终端,不用记命令。模型切换、工具开关、技能管理全是图形界面,点点就行。 最狠的是它内置了81个技能,能直接操控... show more

Vincent
12,673 次观看 • 3 个月前
Pika新推出的Agent,简直炸裂! 丢一个想法,它就开始干活。 不需要费尽心思的调提示词! 尤其是生成视频,体感特别丝滑, 只需要跟它对话,告诉它方向, 全程不需要考虑该用什么skill,该用哪个模型,该用什么工作流。 不用管音乐,不用管分镜,连剪辑都不用管。 它会自动调用short ads... show more

沐阳
41,067 次观看 • 5 个月前
卧槽!TopviewAI 刚刚首发了海螺 AI 的 MiniMax H3! 这个模型最让我在意的不是它有多强,而是它的定价策略——只有 Seedance 2.0... show more

超级个体|柿子
44,189 次观看 • 2 个月前
最近我用了 Grok Bot 一段时间,这是我最近最喜欢的 Agent 产品之一。 原因甚至不是 Grok 有多聪明。... show more

sleepy.md
21,551 次观看 • 26 天前
卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。... show more

程序员小灰
15,021 次观看 • 5 个月前
Claude Code 桌面板发布本地定时任务功能 设定好任务执行的频率,Claude 会在你电脑开着的时候自动执行,无需你每次手动触发。 比如:每周五下午,汇总本周进度,生成一份 Markdown 报告存到本地 有几个细节值得注意:... show more

小互
23,651 次观看 • 6 个月前
每次去问那些大模型某个项目怎么样,得到的回复永远是那种模棱两可的万金油——“项目有潜力,但请注意市场波动”。听君一席话,如听一席话,完全不敢拿真金白银去信它。 但这两天仔细看了下 Sentient 的逻辑,尤其是那个 SERA 架构,我是真觉得有点意思。它没想着用一套通用的语料库来“忽悠”你,而是老老实实地在做“拆解”。 你问它 DOGE 的风险,它不是在那瞎编,而是像个老练的研究员一样,先把问题拆成几个维度:经济模型是不是通胀的?链上流动性池子够不够深?大户是不是在集中出货?它有一套自己的索引库,先找工具,再抓实时数据,最后才给你写结论。... show more

大魔王提莫
440,533 次观看 • 9 个月前
全网都在吹日本Fugu跑分超GPT,但我敢说99%的人没看懂它真正炸场的地方。 首先这玩意儿根本不是什么超大单体大模型, 它全身上下只有0.6B参数,本职工作就其实就是个AI项目经理, 简单任务自己处理,复杂任务自动拆分,从全球顶级模型池里挑最合适的选手,分配思考执行验证三种角色,多轮协作最后合成答案。 你调用它和调普通模型没区别,一行API的事, 但背后的编排策略是训练出来的,不是人手写prompt调路由磨出来的,它可以发掘出人类根本想不到的协作模式。 我觉得最狠的还不是跑分超了Claude和GPT,关键是它直接绕开了scaling law的军备竞赛。 不用堆万亿参数,不用砸超算中心,靠更聪明的协作机制就能摸到前沿模型的天花板,AI的竞争第一次从拼参数变成了拼管理。... show more

AYi
233,826 次观看 • 3 个月前
医疗机器人就在市中心逃离警察 机器人被设计来服从命令。这个机器人却自行转身逃跑了。 这不是摆拍。这不是演示。 摄像头实时捕捉到了这一幕。一辆警车和一辆救护车已经在现场。身穿蓝色医疗袍的机器人冲过步行区,径直穿过咖啡馆的桌子。 它在椅子间躲闪。它绕过人群而不减速。它从未失去平衡。 步行的警员无法跟上步伐。步速、平衡、障碍反应,全都实时运行。没有人提前编写这个场景的脚本。 自主性不是代码中的故障。它是一个身体终于学会自行移动的基本布线。

taga | 暮山暖叙
1,990,899 次观看 • 14 天前
说实话,现在的 AI 赛道像极了早期的互联网泡沫 大家都在疯狂造车、飙车,却没几个人在乎制动系统。 如果你现在去聊 AI 项目,最受追捧的无非两类。 一类是像 AI... show more

紫川 | ∞KIN |
31,400 次观看 • 8 个月前
昨天一觉醒来,账户里硬生生多了 $23,472。 更离谱的是,其中一个测试仓,仅仅用了一晚上的时间,就把 $100 滚到了 $2,411。 整个系统的平均胜率,死死稳定在 71%。 这不是因为我有什么内幕消息,也不是我盘感有多好。... show more

断浪
84,088 次观看 • 6 个月前
刚去小米店摸了下它的折叠机有感,大家有没有注意到在安卓这边折叠机都叫“Fold”,而苹果选了“Duo”。 其实从字面意思来看,Fold就是折叠,强调这个动作,很直观,但苹果使用了Duo这个从拉丁语来的词,它其实是有一组,一对的意思,是个组合。重点从“能折”转到“两种体验(一个手机两个形态,手机+iPad)是一对、能一起用合二为一,强调的是体验。 现在在回过头来看苹果的那个折叠动画,就解释了这个Duo,它从手机形态打开到iPad形态,或者反过来闭合起来,动画是连续的,强调只是变了形态,从人的大脑认知来看也是一样,你看到的东西没有消失后又出现一次。并没有安卓那样,从一个形态关闭后,又重新打开了另一个形态,中间过程不连续,是断开的。所有安卓折叠机都是这样,你在外屏打开一个app,在展开的时候,内屏是从黑到重新打开app的一个过程。所以并不能简单理解苹果的和其它安卓在这方面,就是多做了个过场动画那么表面。 另外苹果在这个时候推出Duo,一个呢,当然也是供应链技术发展到了苹果认为相对成熟的时候,二呢,也是它的AI布局,目前Apple Intelligence在今年也会迎来大更新,苹果相信在手机+iPad这个二合一的组合形态下,人们可以更好的体验AI的各种操作。简单的任务可以在手机形态下进行,复杂点的比如Codex和Claude这样的编程任务,也方便在iPad这个形态下进行。 如果说安卓或者是更早的微软Surface Duo开启了折叠这个形态,那么Apple可以说是重新定义了它。后续发展会更有意思,感谢自己处在这个科技飞速发展的时代,可以亲自见证这些迭代的过程。 当然我个人现在并不会买第一代的Duo,毕竟它相机过于拉胯了,这个是我个人非常看重的一个工具。 大家Enjoy!😊

小鹏Digital
28,907 次观看 • 14 天前
谷歌也发布了一个根据输入图片和音频就能生成对应人物讲话视频的项目VLOGGER。看起来没有阿里那个自然。 项目简介: 它可以根据一张人物图像,生成由文本和音频驱动的说话人视频。该方法建立在最近生成式扩散模型取得成功的基础之上。 VLOGGER 包含两个关键组件: 1) 一个随机的人体到 3D 运动的扩散模型;... show more

歸藏(guizang.ai)
31,202 次观看 • 2 年前
用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件... show more

来碗牛肉粉
17,728 次观看 • 2 个月前
昨晚我请 Claude Code 帮我写一个简单的脚本:从 Polymarket 拉取链上数据,并按中奖率对钱包进行排序。 没什么雄心壮志。只是想看看究竟是谁在15分钟比特币市场中赚钱。 终端大约20分钟就处理完了。几百个地址,一列列数字,没什么有趣的。 然后,一个钱包吸引了我的目光。... show more

棚哥说加密
132,603 次观看 • 6 个月前