Video wird geladen...

Video konnte nicht geladen werden

Zur Startseite

直播第二天,OpenAI推出了【强化微调(Reinforcement Fine-Tuning)】,它可以让你用极少的训练数据,为特定的复杂任务构建专家模型,微调后的o1-mini得分提高80%,反超o1正式版! 特点: 1、只需几十到几千个高质量数据 2、评分机制持续优化模型表现,通过参考答案评估模型输出,支持自定义评分标准 3、增强模型在特定领域的推理能力和准确性,通用AI变专家AI 4、提供完整网页操作界面,可实时监控模型性能变化 适用于编程、科学研究、金融、法律等等不同领域 #openai #openai强化微调 #模型微调

26,383 Aufrufe • vor 1 Jahr •via X (Twitter)

6 Kommentare

Profilbild von AIGCLINK
AIGCLINKvor 1 Jahr

申请地址:

Profilbild von Rainmaker
Rainmakervor 2 Jahren

Which Machine Learning model delivers stronger trading results? Check out this free Substack post where I compare several powerful models that beat the market and show yearly returns of over 20%.

Profilbild von ethanhzoncall
ethanhzoncallvor 1 Jahr

◼︎ 发布会逐字稿/AI摘要: [ ▌ Reinforcement Fine-tuning(RFT)重点 - 基于强化学习演算法训练,优化模型推理能力 - 只需十几个范例即可达到显著效果 - 支援法律、金融、工程、保险等专业领域应用 - 预计2025年正式向所有用户开放 - 与Thompson Reuters合作,用于优化Co-counsel AI法律助手 ▌ 技术细节 - 使用JSONL格式训练资料,每行代表一个训练范例 - 使用独立验证资料集(validation set)避免过拟合 - 验证集中的基因与训练集不重叠,确保真实泛化能力 - 内建评分机制(grader) - 分数范围0-1,支援部分给分 - 提供多种通用评分器 - 未来将开放自定义评分标准 - 使用OpenAI分散式训练基础设施,训练时间从数小时到数天不等 ▌ Berkeley Lab应用案例 - 针对罕见遗传疾病诊断优化 - 全球约3亿人受罕见疾病影响 - 从症状推测可能的致病基因 - 使用1100笔训练资料,来自医学文献与病例报告 - 效能显著提升: - Top-1准确率: 31%(O1 Mini微调) vs 25%(O1) vs 17%(O1 Mini原版) - 完整输出推理过程与基因排序 - 验证数据显示模型具有真实泛化能力 ▌ Alpha测试计划开放申请 - 针对具有专业团队的组织 - 已有初步成功案例: - 生物化学研究 - AI安全性评估 - 法律文件分析 - 医疗诊断辅助 - 提供完整技术支援与训练资源 ▌ Reference ◼︎ Demo影片: [ ◼︎ Alpha计划申请: [ ◼︎ HN讨论: [ ◼︎ Justin Reese研究: [ #OpenAI #AI #MachineLearning #O1

Profilbild von 币安高返佣注册申请 (Parody)
币安高返佣注册申请 (Parody)vor 1 Jahr

真强

Profilbild von OSDev
OSDevvor 1 Jahr

rst @readwise save thread

Profilbild von 农耕
农耕vor 1 Jahr

期待中,希望不要像sora的申请一样遥遥无期

Ähnliche Videos

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 Aufrufe • vor 2 Jahren

Google的教学视频《Introduction to Large Language Models | 大语言模型介绍》(中英双语字幕) 这个视频介绍了大型语言模型(Large Language Models,LLMs)的概念、使用场景、提示调整以及Google的Gen AI开发工具。 大型语言模型是深度学习的一个子集,可以预训练并进行特定目的的微调。这些模型经过训练,可以解决诸如文本分类、问题回答、文档摘要、跨行业的文本生成等常见语言问题。然后,可以利用相对较小的领域数据集对这些模型进行定制,以解决零售、金融、娱乐等不同领域的特定问题。 大型语言模型的三个主要特征是:大型、通用性和预训练微调。"大型"既指训练数据集的巨大规模,也指参数的数量。"通用性"意味着这些模型足够解决常见问题。"预训练和微调"是指用大型数据集对大型语言模型进行一般性的预训练,然后用较小的数据集对其进行特定目的的微调。 使用大型语言模型的好处包括:一种模型可用于不同的任务;微调大型语言模型需要的领域训练数据较少;随着数据和参数的增加,大型语言模型的性能也在持续增长。 此外,视频还解释了传统编程、神经网络和生成模型的不同,以及预训练模型的LLM开发与传统的ML开发的区别。 在自然语言处理中,提示设计和提示工程是两个密切相关的概念,这两者都涉及创建清晰、简洁、富有信息的提示。视频中还提到了三种类型的大型语言模型:通用语言模型、指令调整模型和对话调整模型。每种模型都需要以不同的方式进行提示。 原始视频链接:

宝玉

114,706 Aufrufe • vor 3 Jahren

全球最贵的金融团队都在 GitHub 上开源了什么? 普通人怎么了解量化?直接上手是最快的 Jane Street、Goldman Sachs、J.P. Morgan 等顶级量化与高频交易机构,都放出了代表性的金融/工程工具,帮助普通量化爱好者免费学到机构级的定价模型、实时数据可视化和高精度性能调试能力👇 1. Jane Street magic-trace(5.4k stars) 基于 Intel Processor Trace 的高精度进程追踪工具。普通 profiler 看不清调用栈的时候,它能以纳秒级分辨率记录 CPU 每一条指令的完整执行过程。想深入调试性能、搞清楚程序到底卡在哪里的同学,强烈推荐试试 2. Goldman Sachs gs-quant(10.2k stars) 高盛交易员日常使用的衍生品定价和风险管理 Python 工具包。包含期权、掉期等常见衍生品的完整定价模型和风险计算模块。直接 pip 安装就能用,适合想系统学习机构级量化定价的同学,实用性很强 3. Perspective(原 J.P. Morgan 项目,10.5k stars) J.P. Morgan 开源的实时数据可视化利器,特别擅长处理海量流式行情数据。能快速搭建漂亮的交互式仪表盘和实时监控界面,支持 Jupyter,比很多付费终端还灵活。对做数据分析和行情可视化的朋友非常友好 这三个开源项目,能让你直接用上机构级的定价模型、实时行情仪表盘和高精度性能调试工具,帮普通开发者提升量化分析、数据可视化和代码优化能力,完全免费

梭哈.AI

98,728 Aufrufe • vor 4 Monaten

最近axis robotics其实有一些非常amazing的进展。还没形成paper,但是先简单分享一下激动的心情。 简单来说,过去一年,通过axis社区的数据贡献,我们其实积累了大量manipulation的动作轨迹数据。 但是我们逐步发现,这些数据更大的价值不是直接拿来训练某一个通用大模型,而是作为先验,告诉我们哪些特别的动作和状态值得探索。 最近,我们依靠 LLM 自动化生成场景和任务,然后在这些用户数据和少量自动生成数据的基础上,我们可以用高速、低成本的 RL,把每一个任务快速训练成一个接近 100% 成功率、覆盖大量状态变化的专项 Expert。 这个expert,你可以理解为是axis自研的针对某个特别的动作的专用模型,它专门针对这个任务场景可以取得非常强的泛化能力。 这些 Expert不仅具备很强的泛化能力,同时也可以通过物理和视觉随机化充分利用 Simulation,并进一步迁移到真实机器人,同时持续生成大量高质量、多样化的训练数据。 当我们把这个过程复制到成百上千个任务以后,就得到了一整个专家模型的Network:装箱、分拣、抓取等不同任务都有自己的强 专家模型,再把这些 Expert 的能力和数据统一蒸馏、fine-tune 到一个共享的 Foundation Model 里。 也许有一天,axis也拥有属于自己的海量专家模型甚至做出来属于我们的foundation model。how exciting it is

郡主Christine (✱,✱)

13,698 Aufrufe • vor 3 Tagen