Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

「熊猫吃短信2 - 垃圾短信过滤」新版更新啦。最近又迷恋上了训练小模型,把以前的模型训练过程几乎重新调整了一遍。我让大模型自己尝试超参组合,不断的做实验,代替搜索算法,它夜以继日的跑了半个月,最后告诉我,我的经验参数就是最优的。

51,217 görüntüleme • 5 ay önce •via X (Twitter)

0 Yorum

Yorum bulunmuyor

Orijinal gönderinin yorumları burada görünecek

Benzer Videolar

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

17,513 görüntüleme • 2 ay önce

兄弟们,用上 GPT‑5.6 之后,我这边好像真的开始起飞了。 过去7天,我给它做了一个极限实验。 开放电脑操作权限,往预测市场账户里放了300美元,只留下一句话: “自己想办法赚钱。” 剩下的我没再管。 它先扫描了上千个预测市场钱包,把交易频率异常、靠单次暴利和疑似对刷的地址全部过滤掉。 最后,只留下3个长期胜率接近80%的账户。 然后它自己盯盘,自己判断仓位,自己复制这些钱包的 YES / NO 交易。 中间有止损,也有跟错。 但更多时候,它总能比市场慢半步确认,又快一步跟进去。 7天后我重新打开账户: 300美元,变成了3600美元。 整整12倍。 最吓人的不是赚了3300美元。 而是整个过程中,GPT‑5.6几乎没怎么问过我。 它自己找数据、筛钱包、验证胜率、排除垃圾地址,最后连跟单机器人都自己跑起来了。 以前是人盯着市场找机会。 现在变成AI盯着高手,人只负责给它权限。 我已经把利润全部放回账户,让它继续跑。 说真的,用完这波我有点绷不住。 之前用那些垃圾模型,我还一度怀疑 AI 是不是就那样。 结果不是 AI 没用。 是好模型我用晚了。 感觉只要工具用对,AI 自己找机会、自己执行、自己赚钱,这事已经不是 PPT 了。 离谱的是,我感觉这还只是刚开局。

火山哥🕊️

130,596 görüntüleme • 2 ay önce

被 Astra 震撼后的一个顿悟 —— 要给自己配置无限额度的最强算力 下午 Tibo 重置之后,我又满血复活了,然后重新跑了一个工作任务,做培训资料。 在这之前,因为额度不够,我先用 DeepSeek 4.1 做了一些信息抓取,也跑了一版培训资料。结果怎么说呢,生成出来的东西基本就是一坨,完全不具备可用性,还花了很多时间,烧了大几百万、甚至上千万 token。 这过程中我还顺手研究了一下 CC Switch 和 Open Code X,真挺有意思的。 CC Switch 我感觉做得非常棒,比较轻量,Open Code X 也有一些可取之处。这两个东西如果以后有人能融合一下,我觉得会很有意思。 话说回来。 Tibo 重置之后,我把同一个任务重新交给 Astra 跑了一遍。 结果出来的时候,我直接傻了。 它把我原来文件夹里的资料重新抓了一遍,又结合自己检索到的一些信息,最后整合成了一份可以直接拿来做培训的资料。 最让我惊讶的是,它还帮我配了对应的图片和演示视频。 而我的资料文件夹里,其实相关视频并不少。但它最后挑出来两个,刚刚好就是在我看来最有代表性、也最能说明这个功能的两个。 这个感觉就很夸张。如果只是抓资料、做总结,那还是效率工具。 但它能从一堆素材里面,挑出最适合放在这里的内容,那一瞬间我真的感觉: 它理解了这个东西。 不是简单的检索,也不是信息拼接。 它知道这个培训资料想讲什么,也知道什么东西最适合拿来说明。 有那么一瞬间,让我感觉 AGI 了。 然后我脑子里面冒出来一个非常现实的想法: 我还招什么人? 至少资料检索、竞品研究、培训资料整理、信息汇总这一类工作,我招一个实习生,真没有一个 200 刀的 Pro 账户有用。 而且还便宜高效得多。 我现在只恨一件事: 当初为什么没有多囤几个 200 刀的 Pro… 下一个目标,就是等重新开放之后,给自己配置无限额度的 Pro 账户。 另外下午还跑了一个鹈鹕测试。我不懂背后的运动学细节,但成片的协调、平衡和 taste 已经很惊艳。 9分钟就跑出了这样的效果,很高级 视频放在下面,大家可以自己感受。 “今天,骑得开心”

Robinson · 鲁棒逊

40,281 görüntüleme • 27 gün önce

非常Nice啊,这模型完全免费,Token终于可以自由白嫖了,甚至视频模型都是免费的,太爽了。 它叫Agnes AI,全球模型榜前十,6 月 1 号起把自己家三个核心模型全免费开放了,无限期。图片模型在 artificial analysis 上榜了,文字模型一周被干了一万亿 Token。我把它接进 Claude Code,配起来十分钟的事,Token 随便用。 这玩意到底是什么呢。 Agnes AI 是全球模型榜单前十的一个 AI Lab,这次免费开放的是三个模型,文本、图片、视频。 文本模型叫 agnes-2.0-flash。能写代码,能做知识问答,能跑 Agent,能规划复杂任务。在 Claw-Eval 智能体评测榜进了 Top 10。说真的,这周它还要上 1M 超长上下文,以前用 200K 的模型跑到 150K 就降智,这种破事不用再忍了。 图片模型叫 agnes-image-2.1-flash。图改图、多图融合、换背景、改文字、图像修复,电商主图和广告素材这种反复改的场景,太合适了。最近还加了 4K 超高清输出,最高 4096×4096,生成的图可以直接进印刷,不是那种看着还行一放大就糊的草稿。 视频模型叫 agnes-video-2.0。原生音画同步,首帧生视频、首尾帧生视频、多镜头切换都支持,720P 和 1080P 随便选。 接进 Claude Code 怎么搞,其实很简单。 第一步,去 注册,拿到 API key。 第二步,打开 cc-switch。右上角选 Claude CLI,右上角点 + 号,选自定义配置。把 API key 填进去,请求地址写 格式选 OpenAI Chat Completions。 第三步,点获取模型列表,选 agnes-2.0-flash。 第四步,点左上角设置,找到路由,打开路由总开关,Claude 打开。 完事。 回到 Claude Code 正常发消息,模型就已经切过去了。我试了一个在酒吧吉他弹唱的视频,和真人区别不大。 现在 Token 不要钱,Agent 该跑几轮跑几轮,该拆几步拆几步。反正我觉得这才是免费开放最爽的部分,不只是省钱,是心理上解放了。 我测试了一下视频模型,能用,就是慢了点,文字模型还是比较快的。 开发者文档在 OpenClaw、Hermes、Claude Desktop 的,也有现成教程。

产品经理老王霸

55,427 görüntüleme • 3 ay önce

Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。 你可以使用工程手段来加速推理,例如将语音分片后并发处理然后合并结果,但这里涉及到本地计算资源瓶颈的问题,以及合并分片时容错处理的问题,工程复杂度比较高。 《Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling 》, Whisper 的 Large-v2 model 生成了一系列的 soft targets(也就是概率分布),然后复制 Whisper 网络的第一层和最后一层解码器,最后生成了一个更小、更快效果更好的蒸馏模型 Distil-Whisper。论文数据写的是:速度提高了 5.8 倍,参数减少了 51%,准确度保持在 99%。 这个模型的效果之所以不错,主要还是得益于训练数据的完备,它结合了九个公开可用的语音识别数据集,合并后包含 21170 小时的语音数据,涵盖超过 18260 名说话者和 10 个不同的领域;自从 Whisper 大力出奇迹(它从互联网爬取了 68w 小时的数据,未公开)以后,相信后续语音领域的论文都会配置更庞大的数据集。 Distil-Whisper 目前开源在 Hugging Face 上,模型地址: Demo: Demo 会把模型下载到本地,然后通过 WebGPU 直接在网页上跑起来,测试了下效果,还是挺不错的。 目前仅支持英文,如果想让它支持中文,需要使用同样海量的中文语料数据,重新做一次知识蒸馏,但我觉得即便是这样做,效果也不一定好,因为 Whisper 本身对中文、韩语等支持就不太优秀,这个信息可以从 Whisper 的论文中找到数据支撑。 下面这个视频是 Whisper 和 Distil-Whisper 的对比效果:

Barret李靖

124,482 görüntüleme • 2 yıl önce