Ashlyn He's banner
Ashlyn He's profile picture

Ashlyn He

@AshlynHe112911,338 subscribers

AI穿戴产品创业中 |前字节&牛津AI startup | LSE alum Building ZenStellar @HeAisling 🍠:Ashlyn超爱喝奶茶 📮:[email protected]

Shorts

我把一份真实业绩公告交给金融大模型,结果怎么样? AI读财报,最值得警惕的情况,不是它完全不会回答,而是十几个数字都对,只在某个关键口径上悄悄出错。 最近,我体验了蚂蚁百灵推出的金融增强模型 Ling-3.0-flash-Fin。为了看看它是否真的能进入金融工作流,我没有让它预测股价,而是给了它一份 Alphabet 2026年第二季度官方业绩公告,让它完成数据提取、变化分析和业绩快评。 它很快抓住了三条主线 模型准确提取了Alphabet本季度的主要数据:营业收入1,197.96亿美元,同比增长24%;营业利润407.70亿美元,同比增长30%;营业利润率提升至34%。 在此基础上,它识别出了三个值得关注的变化。 第一,Google Cloud收入同比增长82%至247.68亿美元,营业利润由28.26亿美元增长至88.14亿美元。模型进一步将其与企业AI解决方案、AI基础设施及核心GCP服务需求联系起来。 第二,归属于普通股股东的净利润增长298%,但模型没有把这一数字简单理解为主营业务爆发,而是发现其中包含约990亿美元的权益证券收益,并提醒这类收益具有较强波动性。 第三,虽然经营活动现金流增长至390.69亿美元,但资本支出翻倍至449.24亿美元,导致季度自由现金流转负。模型由此判断,AI基础设施建设正在明显增加Alphabet的资金投入。 这些分析已经不只是摘录数字,而是在尝试区分主营业务增长、非经营性收益和资本开支压力。 但它依然需要人工复核 测试中也出现了一个很典型的问题。 模型在前文把2025年第二季度自由现金流写成244.61亿美元,但这个数字实际对应2025年第三季度。根据现金流量表计算,2025年第二季度自由现金流应为53.01亿美元。 有意思的是,模型在文末“待人工复核信息”中又给出了正确计算。这意味着它具备发现问题和展示计算过程的能力,但没有消除答案内部的矛盾。 此外,它对Google Cloud营业利润率提升幅度的计算也不准确:从约20.7%升至35.6%,正确变化约为14.9个百分点,而不是文中写的21.2个百分点。 这恰好说明,金融模型输出越完整、表达越专业,人工核验越不能省略。 更像研究助理,而不是决策者 一次测试不足以概括模型的全部能力,但Ling-3.0-flash-Fin已经展现出一个有价值的方向:它可以较快完成财报取数、寻找业绩主线、区分经营与非经营因素,并搭建一份结构完整的研究初稿。 它目前更适合作为金融研究助理,帮助使用者减少资料整理和初稿制作的时间,而不是绕过专业人员,直接给出投资结论。 Ling-3.0-flash-Fin 目前可通过 OpenRouter 免费体验: 本文仅记录一次指定材料和提示词下的实际体验,不代表模型在所有金融任务中的表现,相关内容不构成任何投资建议

我把一份真实业绩公告交给金融大模型,结果怎么样? AI读财报,最值得警惕的情况,不是它完全不会回答,而是十几个数字都对,只在某个关键口径上悄悄出错。 最近,我体验了蚂蚁百灵推出的金融增强模型 Ling-3.0-flash-Fin。为了看看它是否真的能进入金融工作流,我没有让它预测股价,而是给了它一份 Alphabet 2026年第二季度官方业绩公告,让它完成数据提取、变化分析和业绩快评。 它很快抓住了三条主线 模型准确提取了Alphabet本季度的主要数据:营业收入1,197.96亿美元,同比增长24%;营业利润407.70亿美元,同比增长30%;营业利润率提升至34%。 在此基础上,它识别出了三个值得关注的变化。 第一,Google Cloud收入同比增长82%至247.68亿美元,营业利润由28.26亿美元增长至88.14亿美元。模型进一步将其与企业AI解决方案、AI基础设施及核心GCP服务需求联系起来。 第二,归属于普通股股东的净利润增长298%,但模型没有把这一数字简单理解为主营业务爆发,而是发现其中包含约990亿美元的权益证券收益,并提醒这类收益具有较强波动性。 第三,虽然经营活动现金流增长至390.69亿美元,但资本支出翻倍至449.24亿美元,导致季度自由现金流转负。模型由此判断,AI基础设施建设正在明显增加Alphabet的资金投入。 这些分析已经不只是摘录数字,而是在尝试区分主营业务增长、非经营性收益和资本开支压力。 但它依然需要人工复核 测试中也出现了一个很典型的问题。 模型在前文把2025年第二季度自由现金流写成244.61亿美元,但这个数字实际对应2025年第三季度。根据现金流量表计算,2025年第二季度自由现金流应为53.01亿美元。 有意思的是,模型在文末“待人工复核信息”中又给出了正确计算。这意味着它具备发现问题和展示计算过程的能力,但没有消除答案内部的矛盾。 此外,它对Google Cloud营业利润率提升幅度的计算也不准确:从约20.7%升至35.6%,正确变化约为14.9个百分点,而不是文中写的21.2个百分点。 这恰好说明,金融模型输出越完整、表达越专业,人工核验越不能省略。 更像研究助理,而不是决策者 一次测试不足以概括模型的全部能力,但Ling-3.0-flash-Fin已经展现出一个有价值的方向:它可以较快完成财报取数、寻找业绩主线、区分经营与非经营因素,并搭建一份结构完整的研究初稿。 它目前更适合作为金融研究助理,帮助使用者减少资料整理和初稿制作的时间,而不是绕过专业人员,直接给出投资结论。 Ling-3.0-flash-Fin 目前可通过 OpenRouter 免费体验: 本文仅记录一次指定材料和提示词下的实际体验,不代表模型在所有金融任务中的表现,相关内容不构成任何投资建议

12,153 Aufrufe

我让 AI 找一个值得做的产品,它盯上了律师账单里的 6 分钟 最近用 AI 做产品调研时,我越来越明显地感觉到一个问题: 信息并不缺,缺的是判断。 问“下一个 AI 机会在哪里”,很容易得到一长串听起来都对的答案:AI 法务、AI 财务、AI 营销、AI 编程…… 但真正准备行动时,还是不知道哪个需求真实存在,哪个只是被反复包装的趋势。 所以这次我换了一种问法。 我让 AI 从用户抱怨、产品评论、GitHub Issues、行业报告和现有产品中寻找信号。每提出一个方向,还必须主动寻找反证:竞争太强、付费意愿不足,或者已经有成熟工具解决,就淘汰。 它一共比较了12个方向。 广告上线前 QA 的损失很直接,但链接和落地页检查已经有成熟工具;AI 代码审计的痛点很强,但市场拥挤,而且人仍然可能需要逐行复核;财务对账高频,却绕不开数据权限和“到底以哪个系统为准”的问题。 最后留下的,是一个我原本完全没有想到的场景: 律师的工时记录与账单叙事(比如美国的法律服务)。 许多按小时计费的律师以0.1小时,也就是6分钟为单位记账。会议、邮件、电话和文档修改结束后,他们还要回忆自己做过什么、匹配案件、补记时间,再把记录改成客户能够接受的账单描述。 AI 在这里不需要替律师做法律判断。 它只需要把日历、邮件和文档活动整理成带来源的候选记录,再由律师确认、修改或删除。 它真正解决的也不是“写得更快”,而是减少漏记、降低审核返工,并让每条收费描述都有依据。 这次测试用的是 Apodex。它里面的 Deep Discover 最让我意外的地方,不是能生成多少想法,而是会主动反驳自己的想法,把一个宽泛的问题逐步收敛成可以验证的假设。 它也没有把这个结果包装成确定的创业机会,而是给出了一套30天验证方案:访谈律师和 billing manager,用脱敏样本测试草稿编辑时间,再验证是否真的有人愿意进入付费试点。 如果律师不愿开放数据、修改草稿和自己重写一样费时,或者现有软件已经够用,那这个方向就应该停止。 我觉得这才是这次测试最有价值的地方。 它没有替我宣布一个答案,而是帮我排除了一批看起来正确的答案,最后告诉我: 下一步最值得验证什么,以及出现什么结果时应该放弃。 有时候,真正有用的 AI 不是让人更快得到结论,而是让一个模糊的问题,终于有了可以行动的下一步。 Open Source Harness: Open Weights: Website:

我让 AI 找一个值得做的产品,它盯上了律师账单里的 6 分钟 最近用 AI 做产品调研时,我越来越明显地感觉到一个问题: 信息并不缺,缺的是判断。 问“下一个 AI 机会在哪里”,很容易得到一长串听起来都对的答案:AI 法务、AI 财务、AI 营销、AI 编程…… 但真正准备行动时,还是不知道哪个需求真实存在,哪个只是被反复包装的趋势。 所以这次我换了一种问法。 我让 AI 从用户抱怨、产品评论、GitHub Issues、行业报告和现有产品中寻找信号。每提出一个方向,还必须主动寻找反证:竞争太强、付费意愿不足,或者已经有成熟工具解决,就淘汰。 它一共比较了12个方向。 广告上线前 QA 的损失很直接,但链接和落地页检查已经有成熟工具;AI 代码审计的痛点很强,但市场拥挤,而且人仍然可能需要逐行复核;财务对账高频,却绕不开数据权限和“到底以哪个系统为准”的问题。 最后留下的,是一个我原本完全没有想到的场景: 律师的工时记录与账单叙事(比如美国的法律服务)。 许多按小时计费的律师以0.1小时,也就是6分钟为单位记账。会议、邮件、电话和文档修改结束后,他们还要回忆自己做过什么、匹配案件、补记时间,再把记录改成客户能够接受的账单描述。 AI 在这里不需要替律师做法律判断。 它只需要把日历、邮件和文档活动整理成带来源的候选记录,再由律师确认、修改或删除。 它真正解决的也不是“写得更快”,而是减少漏记、降低审核返工,并让每条收费描述都有依据。 这次测试用的是 Apodex。它里面的 Deep Discover 最让我意外的地方,不是能生成多少想法,而是会主动反驳自己的想法,把一个宽泛的问题逐步收敛成可以验证的假设。 它也没有把这个结果包装成确定的创业机会,而是给出了一套30天验证方案:访谈律师和 billing manager,用脱敏样本测试草稿编辑时间,再验证是否真的有人愿意进入付费试点。 如果律师不愿开放数据、修改草稿和自己重写一样费时,或者现有软件已经够用,那这个方向就应该停止。 我觉得这才是这次测试最有价值的地方。 它没有替我宣布一个答案,而是帮我排除了一批看起来正确的答案,最后告诉我: 下一步最值得验证什么,以及出现什么结果时应该放弃。 有时候,真正有用的 AI 不是让人更快得到结论,而是让一个模糊的问题,终于有了可以行动的下一步。 Open Source Harness: Open Weights: Website:

15,445 Aufrufe

Claude Opus 4.8 出来之后,我第一时间拿它做了个小测试。 给我们ZenStellar 的 AI 陪伴手链做产品展示页,我一直想做一个能让用户近距离观察手链细节的网站:鼠标移动可以放大看水晶纹理、芯片主珠的细节,像在珠宝展厅里看产品一样。 原本以为这种页面至少要折腾半天,结果把手链细节图丢给 Claude Opus 4.8,再给它一段提示词,大概 5 分钟左右,一个可用的 Demo 就出来了。 比较惊喜的是,它不只是生成静态网页,而是真的把产品展示逻辑想明白了:悬浮、缩放、视差、灯光效果这些细节都直接帮我做了出来。 不过最近直接使用 Claude 其实有点麻烦,我身边不少朋友都遇到过账号限制或者地区问题。我这次是在 ZenMux 里面直接调用 Claude Opus 4.8,用起来就顺手很多,也不用来回切账号或者切平台。 对于做独立站、产品展示页或者 Kickstarter 页面的人来说,Claude Opus 4.8 现在已经不是写代码工具了,更像是一个懂设计的前端合伙人。 说实话,如果放在两年前,我肯定不会相信一个产品展示页能在几分钟内完成第一版。 大家可以从这里进去试试:

Claude Opus 4.8 出来之后,我第一时间拿它做了个小测试。 给我们ZenStellar 的 AI 陪伴手链做产品展示页,我一直想做一个能让用户近距离观察手链细节的网站:鼠标移动可以放大看水晶纹理、芯片主珠的细节,像在珠宝展厅里看产品一样。 原本以为这种页面至少要折腾半天,结果把手链细节图丢给 Claude Opus 4.8,再给它一段提示词,大概 5 分钟左右,一个可用的 Demo 就出来了。 比较惊喜的是,它不只是生成静态网页,而是真的把产品展示逻辑想明白了:悬浮、缩放、视差、灯光效果这些细节都直接帮我做了出来。 不过最近直接使用 Claude 其实有点麻烦,我身边不少朋友都遇到过账号限制或者地区问题。我这次是在 ZenMux 里面直接调用 Claude Opus 4.8,用起来就顺手很多,也不用来回切账号或者切平台。 对于做独立站、产品展示页或者 Kickstarter 页面的人来说,Claude Opus 4.8 现在已经不是写代码工具了,更像是一个懂设计的前端合伙人。 说实话,如果放在两年前,我肯定不会相信一个产品展示页能在几分钟内完成第一版。 大家可以从这里进去试试:

32,177 Aufrufe

Videos

AshlynHe1129's profile picture

Haaland finished his World Cup with seven goals. Messi and Mbappé are now level on eight, with one match left each. So I asked Apodex Apodex a simple question with a not-so-simple answer: who wins the Golden Boot? It first gave Messi a 65% chance, Mbappé 25%, and the field 10%. But the useful part wasn’t the pick. It was what happened when I challenged the reasoning. I asked Apodex to audit its own forecast. It found that the first analysis had underweighted the difficulty of Messi’s final, while not fully translating the more open—but rotation-sensitive—third-place match into Mbappé’s chances. The result: Messi fell from 65% to 61%, while Mbappé rose from 25% to 29%. I then made it remove every claim that couldn’t be traced to reliable sources. Using only five verified inputs—goals, assists, minutes played, FIFA’s tiebreak rules, and the remaining fixtures—it settled at: Messi: 60% Mbappé: 30% Others: 10% The core logic is surprisingly clean: both have eight goals, but Messi leads 4–3 in assists. If they finish level on goals and that assist gap remains, Messi wins. Mbappé’s clearest route is to outscore him. That’s what made this test interesting. Apodex didn’t pretend to know the future—it exposed the evidence, the uncertainty, and the exact reason its confidence changed. This evidence-driven approach has also been validated by Apodex’s recent performance on the FutureX forecasting benchmark. Timestamped on July 16. I’ll come back after the final and check the result. This is a probability forecast based on current evidence, not betting advice. Try it:

Ashlyn He

57,652 Aufrufe • vor 2 Monaten

AshlynHe1129's profile picture

AI 视频生成,到各种 AI Agent,我一直在思考一个问题:AI 最终会如何改变人类创造和体验数字世界的方式? 最开始,AI 帮助我们生成文字和图片;后来,它开始生成越来越逼真的视频。但无论画面质量提升到什么程度,这些内容依然存在一个限制——我们仍然只是观看者。我们可以欣赏 AI 创造出来的场景,却无法真正进入其中,也无法与这个世界产生互动。 最近体验 Alaya World Alaya Lab 后,我第一次感觉,AI 视频生成正在探索一个新的方向:它不只是生成一段视频,而是在尝试生成一个可以被探索的世界。 Alaya World 是 Alaya Lab 推出的交互式视频世界模型。用户可以通过文字、图片或者视频作为初始条件,让模型生成一个动态世界。不同于传统视频生成模型“输入 Prompt,输出一段固定视频”的方式,Alaya World 更像是在探索过程中持续构建环境,用户可以在生成的世界中移动视角,并通过交互指令触发新的事件。 这也是我认为世界模型和普通视频生成模型最大的区别。 过去的视频生成模型解决的是“如何生成一段更加真实的视频”,而世界模型尝试解决的问题是“如何让一个世界持续存在”。如果你进入一个虚拟城市,向前探索,然后回头,你期待看到的是同一个城市,而不是一个重新随机生成的场景。 这背后涉及世界模型最核心的挑战:长时间生成的一致性。模型不仅需要知道下一帧画面应该是什么,还需要理解空间关系、历史状态以及用户行为对世界造成的影响。 Alaya World 在技术层面通过空间记忆机制、历史信息保留以及抗漂移训练等方式,提高长时间生成过程中的稳定性。目前模型支持 720p / 24 FPS 实时流式生成,并展示了超过一分钟的连续探索能力。 让我觉得这个方向有意思的地方,是它可能会重新定义未来数字内容的生产方式。 以游戏行业为例,过去一个虚拟世界需要大量人工制作:美术设计地图、程序编写规则、策划设计剧情。开发者需要提前创造一个固定世界,而玩家进入后按照既定规则体验。 但如果世界模型进一步发展,未来的游戏可能不再只是“开发者搭建世界,玩家进入世界”,而是“开发者定义规则,AI 实时生成世界”。玩家体验的不再是一个完全预设好的内容,而是一个随着交互不断变化的环境。 当然,Alaya World 目前仍然处于早期阶段。实时生成所需的算力成本、复杂环境理解能力,以及更长期、更稳定的世界一致性,都还有很多问题需要解决。但它让我看到一个值得关注的趋势:AI 的竞争可能不会只停留在生成更漂亮的图片和视频,而是进一步走向创造更真实、更连续、更可交互的世界。 过去,人类通过电影记录想象,通过游戏创造虚拟空间。而未来,也许我们只需要描述一个想法,AI 就可以帮助我们生成一个能够进入其中、探索其中的世界。 从生成内容,到生成世界,这可能是 AI 下一阶段最值得期待的变化之一。

Ashlyn He

12,495 Aufrufe • vor 2 Monaten

Keine weiteren Inhalte verfügbar