Загрузка видео...

Не удалось загрузить видео

На главную

Distil-Whisper:让语音识别的速度提高 5.8 倍,参数减少 51%,准确度保持在 99%。 Whisper 在语音识别方面表现卓著,但是它有一个明显的缺点:训练出来的小模型支持的语言比较少,而大模型推理速度又很慢。如果你有海量的数据需要处理,或者对实时性要求略高,那使用 Whisper 可能会让你比较头疼。 你可以使用工程手段来加速推理,例如将语音分片后并发处理然后合并结果,但这里涉及到本地计算资源瓶颈的问题,以及合并分片时容错处理的问题,工程复杂度比较高。 《Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling 》, Whisper 的 Large-v2 model 生成了一系列的 soft targets(也就是概率分布),然后复制 Whisper 网络的第一层和最后一层解码器,最后生成了一个更小、更快效果更好的蒸馏模型 Distil-Whisper。论文数据写的是:速度提高了 5.8 倍,参数减少了 51%,准确度保持在 99%。 这个模型的效果之所以不错,主要还是得益于训练数据的完备,它结合了九个公开可用的语音识别数据集,合并后包含 21170 小时的语音数据,涵盖超过 18260 名说话者和 10 个不同的领域;自从 Whisper 大力出奇迹(它从互联网爬取了 68w 小时的数据,未公开)以后,相信后续语音领域的论文都会配置更庞大的数据集。 Distil-Whisper 目前开源在 Hugging Face 上,模型地址:...

124,227 просмотров • 2 лет назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

MiMo推出1000 Token/s超高速模型|体验测评 MiMo 推出了 MiMo V2.5 Pro UltraSpeed 超高速的模型版本,能够实现每秒输出超过 1,000 Token 的速度。 同时,这应该也是全球第一个达到这个速度的万亿(1T)参数模型。 藏师傅提前试了一下,做了三个测试,确实爽。 第一个跑了一个比较复杂的 3D 采矿小游戏测试。在没有素材的情况下,我让它全部用 Three.js 前端代码来生成素材。整体要求比较完整,虽然第一次实践时出了一些小问题,但在跟他沟通修改建议后,非常完美地实现了任务。 这次测试的各项指标如下:思考的 TPS:804 Token/s,峰值速度:810 Token/s,首次响应时间:4.71 秒。 第二个测试给了一个官网,其头部包含一个相对复杂的 3D 动画。 这次的输出速度快了非常多:峰值达到了 1426 Token/s,首次响应只用了 0.83 秒,在 32 秒内输出了 25624 个 Token,总计生成了 1000 行代码。 第三个测试给了一个更复杂的官网。我要求这个官网的 Header 头部包含以下 3D 效果:地球边缘、轨道上的飞船、星际尘埃、航线图、舷窗的 HUD 样式。 这个效果非常好,整体的视觉样式、状态、SVG 动画和驾驶卡片都非常精细,还有滚动的视差效果 这个输出的 TPS 达到了 1136 tokens/s,首次响应是 4.5 秒 官方测试平台下面有个数据展示,会显示相关信息 在流式输出的情况下,当你看着它只用 20 秒就产生一个非常复杂的 3D 游戏时,那种场景还是比较震撼的 之前的这些(比如说 Groq 之类的)超高速推理方案,在模型能力或者是整体水平上都会有所下降,但是 MiMo 这个在测试的时候,我没有看到这种迹象 最近很多公司都开始推出这种超高速的 API 服务,比如之前 OpenAI 和 Anthropic 都有 Fast 模式 在 Agent 场景下,模型输出效率的提升会直接带动每一步 Agent 操作的效率: 如果一个任务预估一分钟完成,你就会盯着它直到结束,然后立刻投入测试。如果需要五分钟才完成,你可能就会去干别的事,然后再回来看,难免会浪费一些时间 这种效率提升在 Sub-Agent 和并发场景下更加明显。因为它可以更快地产出大量结果,想象一下,如果同时启动一两百个 Sub-Agent,在模型能力没有衰减的前提下,速度提高 10 倍,体验是非常爽的 毕竟这本质上是面向那种对效率有极高要求的 To B 客户所推出的 希望后面大家卷起来,优化一下成本,让普通用户也能放开用这种 UltraSpeed 模型

歸藏(guizang.ai)

26,998 просмотров • 2 месяцев назад

最近在 GitHub 上刷到一个挺炸的开源项目:Wren AI 它本质上是在做一件我们都很熟、但一直没被真正解决好的事:让不懂 SQL 的人,也能自己查数据库。 比如说,业务、运营想看数据,第一反应就是来敲后端:“帮我查下上个月销量前 3 的产品”“这个转化率能不能按渠道拆一下”。 SQL 本身不难,但沟通成本、来回确认、临时插队,才是真正耗时间的地方。 Wren AI 的思路很直接:对话即查询。 你直接用自然语言问问题,它会自动生成 SQL、跑库、给结果,甚至顺手把图也画好(柱状图、折线图那种)。 可以把它理解成一个 “自带 AI 分析师的开源版 Metabase”,但门槛更低,不用拖字段、不用写 SQL。 比较关键的一点是,它不是那种“裸 Text-to-SQL”。 Wren AI 引入了 Semantic Layer(语义层),你可以提前把业务指标、表关系、口径定义清楚,相当于给大模型加了一层“业务护栏”。 这一步虽然需要懂数据库的人前期配置一下,但一旦理顺,后面业务方基本很难把数据问歪,准确性和安全性都高很多。 模型和部署这块也挺对技术人的胃口: ·云模型:OpenAI / Claude / Gemini 都能接 ·数据不出内网:可以配 Ollama + 本地模型(比如 DeepSeek) ·数据库支持也很全:MySQL、Postgres、ClickHouse、DuckDB 基本全覆盖 ·安装也不折腾,有 Docker 基本就是一键起 整体看下来,我觉得它特别适合两种场景: 1)想给团队搭一套真正能用的自助查数平台 2)想研究 “AI + BI + 语义层” 这种更偏工程化的落地方案 一句话总结:把“查数据”的自由还给业务,把时间还给开发。

sitin

30,018 просмотров • 6 месяцев назад

用 Codex 加 ChatCut,我终于能用自然语言丝滑剪辑我的视频了! 最近一直在研究这个 ChatCut 的 CodeX 插件 他们在自然语言视频作这个层面,绝对是第一梯队 最牛逼的几个点在于: 1. 全自然语言操控 可以用自然语言操作整个剪辑过程 你不需要去手动操作复杂的剪辑轨道,只需要把你的需求用大白话讲给它,它就会自动去调用工具进行剪辑 2. 剪辑与生成无缝集成 它把视频剪辑和生成功能全部集成到了同一个工具里 如果你在剪辑过程中需要某些素材,它会自动帮你去找,或者直接生成对应的素材 整个体验非常顺畅,效果挺屌的 3. 优秀的可视化交互 这是目前我见过交互体验最好的自然语言剪辑工具 安装好之后,左边是你跟 Codex 对话的区域,右边就是它的整个工作区 你可以实时、可视化地看到 Codex 是如何操作你的视频素材进行剪辑的 更爽的是,你还可以直接在右边的工作区里,对刚刚剪辑的视频进行精细化的微调和修改 这种交互方式真的已经非常接近我理想中自然语言剪辑了 不过他们目前也确实存在一些问题, 比如整体的处理速度还是比较慢,以及 Token 的消耗比较大 这也是现阶段的一个局限性,但我觉得未来一定会越来越好 如果对自然语言视频制作感兴趣的兄弟们,一定要去试一下这个插件! 官网链接如下:

来碗牛肉粉

17,728 просмотров • 1 месяц назад

有人靠金融市场模拟,在链上赚了 $400,000 而且用到的整套工具,都是 GitHub 开源 能看到的钱包在这,自己点开看: 他们做的不是 crypto 原生叙事 而是拿 Russell 2000、Dow Jones、SPX、Apple、Google 这些传统金融标的来做 Polymarket 交易 问题也很现实: 这些数据平时都在大型中心化交易所里。 你怎么拿? 拿到之后又怎么处理,才能真的变成可交易模型? 这套公开出来的技术栈,大概是这样: 1)Financial Datasets MCP Server 给任意 ticker、任意时间周期提供价格数据解析。 核心卖点就是:免费真实数据。 GitHub: 2)MiroThinker 一个偏深度研究和预测的 agent。 据说在 BrowseComp benchmark 上做到 88.2。 特点是: 长周期推理 先验证再下结论 步骤级 + 全局级校验 单任务最多可调用 300 次工具 它的作用不是直接下单。 而是先通过 MCP Server 拉数据, 把研究、清洗、验证这些环节跑完, 最后整理成可以直接用于模拟的数据集。 GitHub: 3)MiroFish simulation system 把前面准备好的数据丢进去, 再设定模拟参数, 就可以开始跑价格行为模拟。 本质上,它卖的不是一个指标。 而是一种更接近“矩阵视角”的东西: 价格在不同条件下会怎么动 哪些路径更常见 哪些定价其实偏离了历史结构 整个流程串起来就是: 拉传统金融历史数据 → 用 agent 做研究和数据整理 → 把数据送进模拟系统 → 再拿结果去打 Polymarket 上的相关市场 这种玩法最值得看的,不是“开源”两个字 而是它说明了一件事: Polymarket 上很多看起来像事件交易的东西,背后其实已经在被人用传统金融数据 + agent 研究 + simulation当成量化问题来做。 你觉得这种 edge 的核心,更像是数据获取能力,agent 研究能力,还是最后那层 simulation 对市场行为的还原能力?

0x_Miko

23,786 просмотров • 5 месяцев назад

有个事我憋很久了,今天必须说一下。 市面上那些标榜 AI 驱动交易的 Bot,我深度用过几款之后发现一个特离谱的现象:它们所谓的 AI 就是接了一个 GPT 或者 Claude 的 API,把 K 线数据原封不动丢进去,让一个从来没被训练过理解金融时间序列的通用模型给你输出买卖建议。说难听点,跟拿 ChatGPT 算命没什么区别。 所以 AIX 的多模型路由方案,是我接触这个项目之后第一个真正觉得"方向对了"的设计。 它同时接了 GPT、Claude、DeepSeek R1、Gemini 这些通用模型,也集成了 Kronos 这类专门为金融预测训练的专业模型。中间多了一层调度层,根据当前市场状态智能路由,震荡市用一套推理框架,单边趋势切另一套算法组合。 这个设计的聪明之处在于它承认了一个很朴素的事实:没有一种模型能在所有行情里通吃。趋势跟随在单边市是神,进了震荡就是来回止损。反过来网格在震荡舒服,单边一来直接穿仓。通用大模型做策略意图理解很强但看 K 线的能力确实有限,专用金融模型在时序预测上更精准但没办法理解你用自然语言描述的策略逻辑。没有一个模型能同时搞定所有事。 AIX 干的事不是选一个最强的模型然后迷信它,而是让不同模型在不同环节轮班上岗,动态调权重。这个思路在传统量化里叫多因子动态权重,AIX 把它搬到了 LLM 和时序模型的协同上。 我体验下来的感受是它不像那种一问一答的 Bot,更像有一个小团队在后台协作,你只需要给方向,它自己去协调谁干什么。这个架构如果跑通,抗单一模型失效的能力跟那些只接一个 API 的项目不在一个数量级。 个人分享,非投资建议。

DeFi狙击手 | Ai🕊️

17,513 просмотров • 1 месяц назад

卧槽,答案终于揭晓了! 那个在open router上持续霸榜的神秘模型,是阿里推出的全新大模型“蚂蚁百灵”!今天我们来深度聊一聊这个模型。 用过AI来完成前端开发的朋友肯定懂: 要让AI做出想要的UI总是要找参考,再不然就是要依赖设计 skill 的帮助。 但这种界面一旦看多了,就会陷入审美疲劳。 原因在于不管你是对标UI还是使用skill,结果都是被限定在固有的生成范围内。 最近小灰测了新模型 Ling-2.6-1T (由蚂蚁集团 Ant Ling 开发),发现它刚好就能打破这个限制。 它生成的页面不仅审美极度在线,而且自带高质量的交互效果,做出来的东西终于不再是干巴巴的呆板网页了。 但用它有个必须要避开的坑:Ling 2.6 1T 默认是没有深度思考模式的。 它在计算资源分配上极其克制,如果你偷懒丢一句"给我写个好看的界面",那么它大概率会给你一个准确但极其敷衍的结果。(视频1) 那么怎么取巧使用它? 小灰分享一个能逼出它真实设计水平的实操工作流:把它当成主规划师,先拆解风格,再写代码。 跟它对话时,你可以直接下这种指令: 1. 强制思考:先别急着写代码!帮我分析这个产品的定位,明确它的视觉情绪、色彩规范和排版布局,把思路列出来。(比如明确告诉它你要包豪斯风格或者北欧风)。 2. 落地执行:等它把设计语言梳理清楚,你确认没问题了,再让它基于这套标准去生成具体的 TailwindCSS 样式和前端页面。 用这种先 Plan 后做的方式,出来的页面不仅美观,而且风格极其统一。(视频2) 目前在Openrouter中可以免费体验该模型。 选对工具打破模板限制,用高审美的模型直接拔高视觉质感,能帮我们省下大把死磕 CSS 的时间。 期待大家都能快速做出让人眼前一亮的作品!

程序员小灰

15,021 просмотров • 4 месяцев назад

那个Now @zama真人摸草改规则了,没有做的可以去做一下,很好通过的,做过的也去看一下角色有没有掉,掉了的话按照下面新规则重做一下~ (社区管理说只是为了有趣,我感觉像在变相认证真人,视频像我这样就行了,公园好多人,有点紧张,环顾下四周,念完我就跑了) 新规则Touched Grass角色获得👇: 1⃣找一个绿色的草地蹲下 2⃣准备一张白纸写上你的discord用户名放在草地上 3⃣大声朗读:I'm touching grass, so i'm probably not a bot 4⃣用手机拍下视频上传到discord中的chat频道 5⃣同时随便@一个处于在线状态的Volunteer角色者 6⃣志愿者在线的话审核是很快的,我不到1分钟就通过了 传送门: #ZamaCreatorProgram ⭐什么是全同态加密 (Fully Homomorphic Encryption, FHE) 呢? FHE就像是一个“能戴着手套做精细手术”的加密技术——你可以在不解密的情况下,直接对加密数据做各种复杂计算,但全程是看不到原始数据的。 ⭐FHE解决了什么问题? 比如在云计算、大数据分析、医疗研究等场景中,我们经常需要把数据交给别人处理(比如云服务器),但又怕隐私泄露。FHE允许服务器在不知道数据内容的情况下直接处理加密数据,服务器将处理结果返给你后,此时你用密钥解密,得到的就是处理后的正确结果。 ⭐FHE神奇在哪里? 1.加密数据也能“算数学”:比如你加密了两个数字 加密(3) 和 加密(5),发给服务器,服务器可以直接在加密状态下计算 加密(3) + 加密(5),得到的结果是 加密(8)(而不是8!)。你解密后得到的就是8。 2.支持复杂计算:不只是加减乘除,甚至能算机器学习、数据库查询等复杂操作。 ⭐总结: FHE是一种“终极隐私保护技术”,让你能放心把加密数据交给别人处理而不泄露任何信息。虽然目前效率还不够高,但它是隐私计算领域的“圣杯”,未来在数据敏感场景中会越来越重要。

zhouzhou (🪂Airdrop Daily Check🔍)|(❖,❖)

11,644 просмотров • 1 год назад

大半夜体验完 Manus AI, 达到了今天的使用限制,说一下自己的感受🧵 整体来讲,真的很强大, 主要体现在 Manus 能够: 🔧展示完整的推理逻辑,有个 Manus 电脑的东西为你呈现所有过程和进展; 🏗️调用各种API 协同完成任务; 📃最终非常实际的交付给你一个可用的文件。 🌟「真正能干活」的AI Agent,这个定位真的太准确了。 以下是一些实例: 1️⃣基础任务完成度高 比如最近日本可以看樱花了,整理一个具体的旅行清单包括日程、推荐景点、住宿、交通等等; 家里领导喜欢看红楼梦,梳理一下红楼梦的人物关系。 以下是分别让他做的一个 pdf 文档和可以互动的网页,完成度是真的很高,不过人物关系上有一点小错误,无伤大雅。 其他比如让他阅读视频给到总结,甚至让他剪辑播客都是可以的(只是效果不太好)。 但是我尝试让他给我画一些图🗺️,这方面还有所欠缺,给到的理由是第三方 API 接口出错。同时网上说她可以做ppt,确实是可以的,但是能做ppt的工具都存在一个共同问题,逻辑还行,但就是丑。所以“美术”相关工作我理解还是做不了的。 另外,他是一个完成特定任务的助手,不要把它当作聊天机器人,不然他每次跟你聊天都要思考十几分钟,真的很难受。 2️⃣测一测他懂不懂Web3 给了两个任务: a) 我们今天发了一个depin的研报,花了一个多月,自认为还行,让他给这个研报评分,并且给到其他更好的文章推荐。 我们的depin报告如下 他给到的内容如图3,更详细的评价文档我传了一个Google 链接,放在最后了,各位可以自行查看(包括前面的红楼梦人物关系图)。 整体来看,他快速学习和阅读了大量 web3 depin 的报告,并且从多个维度给出了我们报告的评价,以及推荐的其他报告和对应的评价。 b) 假设我是一个 交易所cmo,如何做华语市场的传播策略,包括华语媒体和华语kol的整理和评级。很遗憾,我已经等了一个多小时他还没思考完,如果明天有结果,我也会传到Google link里。(Manus 可以离线、多任务思考,所以可以同时开启多个任务,或者关机后之前的任务仍然会运行) 不过我看到了他的实时分析过程,在阅读各个媒体、kol 的官网文章,历史推文等等,形成自己的分析。见图4 所以我理解在他的大脑里是有 web3 内容,并可以实时学习的。 3️⃣除了懂,他能否与 Web3 交互 以上的推理其实都和 Web3 没有实际关系,我更关心他能否拿到链上数据,甚至能够交互。比如是否知道 $SOL $ETH 能在哪些地方质押,收益如何等等,还有一些深入的分析问题。 很遗憾,今天的使用次数达到限制了。明天再说吧👋 -------------------------------------------- 等待 Manus 思考结果的时候,我也看了一些其他的博主评价和官方的介绍,我觉得有一点说的很好: “没有开源,就没有 Manus AI” 从一个体验过多个AI产品的小白角度,我其实觉得 Manus 会这么火爆的原因主要在于:调用了多种 API 接口,配合自己的推理算法最终呈现了一个很好的产品。 这让我想到 ai16zdao 每周都有新的人贡献 plugin(比如 微信,deepseek),让这个网络不断壮大; Virtuals Protocol 通过打通 agent 得底层框架,形成 agent 经济体;还有 Hey Anon 不只是有链上数据,还能直接帮你交互等等。 某一天,web2 和 web3 的 AI 产品肯定会更加紧密的相互协作,并出来几个不错的case。 最近有一些 betting 的产品已经初现端倪。 Manus 也会开源自己的能力,为了更大的 AGI 世界。 如果真到了那一天,我就真的要失业了🥲 ( Google drive 素材链接:

Zolo 🌊

40,420 просмотров • 1 год назад

Google推出了一种在 StableDiffusion 图像生成中保证内容特征一致性的方式。 这个其实是现在图像生成中一个非常重要的问题,故事可视化、游戏开发资产设计、广告等都需要在生成的时候具备角色或者内容的一致性。 从演示来看效果非常好人物角色和其他内容的特征都保持的非常好,他们有一个示例是一个男人的一生十几张不同年龄段的图片都很像能看出来是一个人。 而且这个项目还可以跟 SD 已有的控制方式结合,比如局部重绘和 Controlnet 等。下面是具体的介绍: 实现方法: 身份聚类:这一步骤涉及首先生成一系列图像,然后将这些图像嵌入到一个语义空间中。接着,使用聚类算法将这些图像分组,每个组代表一种可能的角色身份。这个过程旨在识别出一组视觉上一致的图像,从而确定角色的主要视觉特征。 身份提取:在确定了一组具有高内聚性的图像之后,接下来的步骤是通过在这些图像上训练模型来提炼出一个更一致的角色身份。这意味着模型将学习到特定角色的关键视觉特征,以便在未来的生成中更准确地重现这些特征。 收敛性:方法的最后一个步骤是迭代过程,该过程在达到一定的收敛标准时停止。在每次迭代中,模型基于最新的训练数据生成新的图像,并重新进行聚类和身份提取。这个过程重复进行,直到模型能够可靠地生成具有一致视觉身份的角色为止。 效果验证: 定性和定量比较:在这一部分,作者将他们的方法与其他个性化文本到图像生成技术进行比较。这包括通过视觉和数值指标来评估生成图像的一致性和质量。 用户研究:作者还进行了一项用户研究,以评估他们的方法在实际使用中的效果。这包括让用户评价生成图像的一致性和吸引力。 消融研究:这部分是对方法中不同组件的效果进行评估。通过修改或移除方法的某些部分,作者能够理解每个组成部分对最终结果的贡献。 论文链接:

歸藏(guizang.ai)

125,824 просмотров • 2 лет назад