Video yükleniyor...

Video Yüklenemedi

Ana Sayfaya Dön

百度突然放出其文心大模型4.5和推理模型X1,并宣布完全免费😃 此前宣布的是原定于4月1号发布4.5 并免费。 同时百度宣布根据基准测试多模态理解、文本和逻辑推理能力显著提升,在多项测试中表现优于GPT4.5,且其API调用价格仅为GPT4.5的1%。 而且百度还发布了自己的深度推理模型X1,性能对标DeepSeek-R1,并增加多模态、多工具调用能力,也是免费使用,API调用价格约为R1的一半。 文心大模型4.5的输入价格为0.004元/千tokens 文心大模型X1 的输入价格为0.002元/千tokens 简单测试了下X1 初步感觉还是不错的,思考过程非常的清晰,回答也很不错,还会帮你思考更多。

62,698 görüntüleme • 1 yıl önce •via X (Twitter)

11 Yorum

小互 profil fotoğrafı
小互1 yıl önce

基准测试结果

小互 profil fotoğrafı
小互1 yıl önce

价格对比:便宜是真便宜😅 所有人现在可以直接在文心一言官网免费体验。 🔗:

小互 profil fotoğrafı
小互1 yıl önce

文心一言4.5 写作能力测试 黔东南山野里的童年美食 我们那里,在黔东南的深山褶皱里,乡村的日子像山间的溪流,清瘦却悠长。小时候,土地是贫瘠的,庄稼收成总是单薄,可山野却慷慨地馈赠着各种美食,滋养着我们的童年。 春天,当第一缕春风拂过山林,蕨菜便像一群调皮的孩子,从土里探出了嫩绿的脑袋。我们一群小伙伴,背着小竹篓,穿梭在山林间。那时候,找蕨菜可是件趣事。它们有的藏在草丛深处,只露出一点点嫩绿的尖儿;有的则大大咧咧地长在显眼处,仿佛在等着我们去采摘。我总是眼尖,不一会儿就能找到一大把。采回家后,奶奶会把蕨菜洗净,焯水,然后切成小段,配上自家腌制的腊肉一起炒。那腊肉的咸香与蕨菜的鲜嫩完美融合,每一口都充满了山野的味道。 除了蕨菜,折耳根也是春天里不可错过的美味。它生长在潮湿的溪边、田埂上,带着一股独特的腥味。小时候,我不太喜欢这股味道,可大人们却爱得不行。妈妈会把折耳根洗净,切成小段,加上辣椒、醋、酱油等调料凉拌。一开始,我总是捂着鼻子不肯吃,可看着他们吃得津津有味的样子,忍不住尝了一口,没想到那独特的味道竟在舌尖上散开,越嚼越香。后来,我也爱上了这道凉拌折耳根,每次春天去采野菜,都会特意留意折耳根的身影。 夏天,是野果成熟的季节。我们那里有一种野果叫“地泡儿”,它像一颗颗小巧玲珑的灯笼,藏在草丛里。地泡儿成熟时,外皮是红彤彤的,上面还有许多小颗粒,就像镶嵌着一颗颗红宝石。轻轻咬一口,酸甜的汁水在口中四溢开来,那滋味至今让我难以忘怀。还有刺泡儿,它长在带刺的灌木丛上,采摘的时候可得小心,不然就会被刺扎到。但为了能品尝到那甜美的味道,我们总是顾不上这些。刺泡儿比地泡儿更甜一些,口感也更软糯,每次吃到嘴里,都觉得自己是世界上最幸福的孩子。 秋天,是收获的季节,山野里的美食也更加丰富。野板栗成熟了,它们像一个个小刺猬,挂在树上。我们会拿着长长的竹竿,把野板栗打下来,然后戴着手套,小心翼翼地把它们从刺壳里剥出来。野板栗比家养的板栗个头小一些,但味道却更浓郁。奶奶会用野板栗炖鸡,那汤浓得呀,喝上一口,从嗓子眼儿一直暖到心里。还有野葡萄,一串串紫莹莹的,挂在藤蔓上,像玛瑙一样。野葡萄的味道很酸,但我们还是会摘上一大串,一边吃一边酸得直咧嘴,却又乐此不疲。 冬天,山野里看似寂静,却也有独特的美食。冬笋,是冬天里的一抹惊喜。爷爷会带着我去竹林里挖冬笋。找冬笋可是个技术活,要看竹子的朝向、地面的裂缝等。爷爷经验丰富,总能准确地找到冬笋的位置。用锄头小心翼翼地挖开土,白白胖胖的冬笋就露了出来。回到家,奶奶会用冬笋炒腊肉,冬笋的鲜嫩与腊肉的咸香相互映衬,那味道,在寒冷的冬天里,给人带来无尽的温暖。 我们那里的乡村,虽然贫瘠,但人们却用质朴的方式创造着美食。记得有一次,村里来了客人,大家拿出自家最好的食材来招待。没有精致的餐具,没有复杂的烹饪技巧,只是一些简单的山野食材,却做出了一桌丰盛的美食。大家围坐在一起,欢声笑语,那温馨的场景至今仍历历在目。 小时候,我不懂为什么大人们总是对这些山野美食如此钟情。长大后,离开了那片土地,在城市里品尝着各种精致的美食,却总觉得少了些什么。后来才明白,那些山野美食不仅仅是一种味道,更是我们对家乡、对童年的深深眷恋。 如今,每次回到家乡,我都会去山野里走走,寻找那些曾经熟悉的美食。虽然岁月已经改变了家乡的模样,但那些美食的味道却永远留在了我的记忆深处。它们就像一把把钥匙,打开了我童年的大门,让我回到了那个充满温暖和欢乐的时光。 在黔东南的山野乡村,那些贫瘠土地上的质朴美食,是我童年最珍贵的回忆。它们承载着家乡的味道,承载着亲情的温暖,无论我走到哪里,都永远无法忘怀。

Raj Jha profil fotoğrafı
Raj Jha1 yıl önce

I made $4.2M from $500 this way: - Idea - FB Ad Test - Iterate - Statistical Analysis - Revenue Experiment - Scale a Winner This isn't a vague feel-good tweet This is how you use the scientific method to start a profitable business on the cheap

Peter-Meng profil fotoğrafı
Peter-Meng1 yıl önce

主要是百度这个名字听着就反感

罗伟 profil fotoğrafı
罗伟1 yıl önce

完全免费我也不用,总感觉百度不干净。

s d profil fotoğrafı
s d1 yıl önce

吓人,这百度还是远离比较好

趙國棟 profil fotoğrafı
趙國棟1 yıl önce

我觉得开源模型是一种智商税

Normalmap profil fotoğrafı
Normalmap1 yıl önce

百度的东西再好也不用

头雁 profil fotoğrafı
头雁1 yıl önce

免费 主要还是塞给你 医疗广告。

ray profil fotoğrafı
ray1 yıl önce

跟deepseek大差不差,但是现在需要的是突破deepseek而并非同等能力甚至还比不上的竞品

Benzer Videolar

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 görüntüleme • 2 yıl önce

抱歉我们只有超大杯! GLM-4.7实测! 本次测试覆盖了GLM-4.7的编程能力, Agent/ToolCall能力, 长上下文召回能力, 给大家带来刚发布的 GLM 4.7 的测试结果: 考验Agent能力的硅基骑手测试, 简单讲是让大模型使用工具模拟骑手取外卖送餐. GLM 4.7 在24小时总计300回合的极限送餐中收益达到了 571.91 元, 执行了总计 354 次 tool call, 测试使用了大约 50% 的上下文空间, 直到超过100K后才停止工作. Agent 测试这次是创了新高, 执行效率特别高, 得益于模型可以在一次会话中发起多个 tool call, 节省了时间并能选择收益最大的方案. 然后是考验长上下文召回能力的霍格沃茨测试, 简单来讲就是在长上下文中, 能否记住上下文并准确的回答问题. GLM 4.7 在192K以内召回水平在91%到100%区间, 而200K也有95%, 召回效果同样也很不错. 最后再来看编程能力测试上最大的感受是粒子, 建模, 光影效果都有提升, 尤其是空间能力有了巨大的提升. 当然性能问题仍然存在, 希望下个版本着重优化下生成代码的性能问题. 总结, 这次GLM 4.7 在各个方面都有明显的提升, 作为主力编程模型不是问题, LMArena 和 SWE-bench 等编程测试中都取得了开源大模型 SOTA 的水平. 不过还是要说一句, 测试中我发现API速度时快时慢, 是不是因为大家都在用新版本导致的? 希望官方赶紧加机器. #GLM47 #智谱AI #智谱GLM #AIAgent #ai编程 #大模型 #开源 #KCORES大模型竞技场

karminski-牙医

19,592 görüntüleme • 9 ay önce

GPT-4.5 重磅发布:天价算力背后的性能迷局,AI Scaling Law 到尽头了吗? 2025 年 2 月 27 日,OpenAI 正式发布了其迄今为止规模最大的 AI 模型——GPT-4.5(代号 Orion)。尽管 OpenAI 表示 GPT-4.5 是该公司有史以来算力和数据规模最大的模型,但这次的性能提升并未像此前 GPT 系列一样带来革命性的飞跃。不仅如此,GPT-4.5 高昂的运行成本和在一些关键基准测试上的表现差强人意,甚至让外界开始怀疑——AI 长期依赖的Scaling Law(规模定律),正在走向终点了吗? 巨型模型、巨额成本,但性能未如预期 此次 GPT-4.5 发布最引人注目的,莫过于其惊人的成本——每 100 万输入 token 收费 75 美元,输出 token 更高达 150 美元。这意味着 GPT-4.5 的成本是 OpenAI 自己广泛使用的主力模型 GPT-4o 的30 倍,更是竞争对手 Claude 3.7 Sonnet 的25 倍。 OpenAI 发言人承认,GPT-4.5 的运行成本之高,使得公司必须重新评估它未来是否适合长期开放 API。 如此巨额成本背后,GPT-4.5 的性能究竟如何呢? 性能迷雾:优势与劣势并存 尽管 OpenAI 将 GPT-4.5 定位为非推理模型(Non-Reasoning Model),但它的表现却出现了明显的两极分化。 ✅ 明确的性能提升领域: - 事实性问答 (SimpleQA) 基准测试中,GPT-4.5 优于 GPT-4o 和 OpenAI 的推理模型 o1 和 o3-mini,幻觉(hallucination)的频率也明显降低。 - 软件开发(SWE-Lancer) 测试中,GPT-4.5 表现优于 GPT-4o 和 o3-mini,在开发完整软件功能时具有更高的可靠性。 ❌ 性能不及预期的领域: - 在高难度的学术推理类测试(如 AIME 和 GPQA)中,GPT-4.5 表现低于竞争对手 Claude 3.7 Sonnet、DeepSeek R1 和 OpenAI 自家的推理模型 o3-mini。 性能对比之谜:成本 vs 性能提升 GPT-4.5 虽然在一些特定任务上确实表现出色,但考虑到成本的激增,性能并未出现对应比例的显著提升。特别是在需要深度推理的任务上,GPT-4.5 远不如更便宜的推理型模型 Claude 3.7 Sonnet 和 OpenAI 的深度推理模型 Deep Research。 Devin 公司 CEO Scott Wu 在推特上也指出,GPT-4.5 在涉及架构设计和跨系统交互的任务上表现突出,但在纯粹的代码编写和编辑任务上却逊色于 Claude 3.7 Sonnet。这种性能的细微差别进一步证明,单纯的扩大模型规模,可能已不能带来跨领域全面的性能跃升。 从性能到情感智能:“微妙的提升” OpenAI CEO Sam Altman 提到了 GPT-4.5 独特的魅力——它带来了以往模型所缺乏的“人性化”的感觉,虽然在数学、代码等硬核推理领域并不出彩,但在理解人类意图和情感回应方面达到了新的高度。 OpenAI 展示了一个情感交流的案例,当用户表示考试失败而难过时,GPT-4.5 给出的安慰更为贴心且符合社交情境:(图 4) 正如 Andrej Karpathy 所言:“每代 GPT 都是微妙的提升,一切都变得更好一点,但无法具体指出哪一项是绝对的突破。” Scaling Law 失效了吗? 此次 GPT-4.5 发布最令人关注的一点,在于它似乎验证了 AI 界早有预言的“规模定律的终结”。OpenAI 联合创始人 Ilya Sutskever 曾直言:“我们已经达到了数据的巅峰,传统的预训练方式即将终结。” GPT-4.5 的性能曲线证实了他的预测——随着模型规模继续扩大,其性能的提升不再显著,甚至出现了严重的成本与收益不成比例的现象。 市场也开始感受到这一趋势: > “DeepSeek R1:我们不再需要大量 GPU 进行预训练; OpenAI GPT-4.5:我们已到 GPU 预训练的尽头。” GPU 算力瓶颈已成新常态,甚至引发了 GPU 供不应求的现象,这背后反映的是产业链面对 AI 规模困境的真实反应。 GPT-4.5:AI 发展的分水岭? OpenAI 已明确表示 GPT-4.5 不会成为 GPT-4o 的替代品。相反,它更可能是 OpenAI 向 GPT-5 和未来结合推理模型路线的转折点,象征着公司逐渐告别单纯依赖大规模预训练的时代。 总结而言: GPT-4.5 展示了 AI 在预训练模式下的规模极限。 性价比问题凸显,纯规模化扩张已无法带来突破性进步。 情感智能提升明显,可能开启 AI 交互方式新趋势。 此次 GPT-4.5 的发布,或许正是 AI 发展道路上的重要里程碑——它提醒着我们,未来的 AI 模型,也许需要的不再只是更多的 GPU 和数据,而是对智能本质的更深入理解。 GPT-4.5 的登场,最终是否宣告 AI Scaling Law 的终结,仍有待时间检验。但毋庸置疑的是,AI 产业已站在变革的路口,传统的规模化预训练模式即将迎来一次深刻的反思与变革。

宝玉

80,154 görüntüleme • 1 yıl önce