Загрузка видео...

Не удалось загрузить видео

На главную

我用一台24GB Mac,实现了“Token自由” 最近,我在一台24GB内存的M4 Mac mini上,本地部署了Qwen3.8-27B。 不是缩水版,也不是调用云端API,而是: 😎Qwen3.8-27B完整模型 ☑️MLX 4-bit量化 ☑️MTP推测解码加速 ☑️支持文字、图片和思考模式 ☑️提供OpenAI兼容接口 ☑️所有对话完全在本机完成 这套模型的主体大约15GB,MTP草稿模型约256MB,实际运行峰值内存约18.17GB。 也就是说,一台24GB的Apple Silicon Mac,确实可以把27B级别的多模态模型装进口袋里。 / 我把上下文设置为8K、并发设置为1,并启用了MTP block size 3。在这台M4 Mac mini上的实测结果是: 普通短回答约4.12 token/s MTP接受率较高时接近9.94 token/s 1:文字对话正常 2:图片识别正常 3:思考模式正常 模型启动大约需要6~8秒 它当然没有小模型那么快,也比不上云端服务器集群。 但它有一个非常重要的优势:不再按Token付费。 模型下载完成以后,即使断开网络也能继续运行。聊天记录、图片、文件和提示词都不需要离开自己的电脑。 可以用它做翻译、总结、写作、代码分析、资料整理,也可以通过OpenAI兼容接口接入自己的工作流。 浏览器只是一个聊天界面,并不是必需的。终端、桌面客户端或者自己编写的程序,都可以直接调用这个本地模型。 我给它分配了独立目录、独立Python环境和独立端口,我主要为了千问和电脑里原有的百灵模型共存。 只是24GB内存不适合同时加载两套大模型,使用时切换即可,不会影响原有模型文件。 #Token自由 #Qwen #MLX #MTP #AppleSilicon #MacMini #本地大模型 #AI部署

30,119 просмотров • 2 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 просмотров • 2 лет назад

OpenAI 的大神 Andrej Karpathy 前几天在他的 YouTube 频道讲了一堂课,系统的介绍了大语言模型,内容深入浅出,非常赞,抽空将它翻译成了双语,由于内容较长,我将分批上传,以下是第一部分精校后的双语视频,字幕文稿如下: Intro: Large Language Model (LLM) talk 大家好。最近,我进行了一场关于大语言模型的 30 分钟入门讲座。遗憾的是,这次讲座没有被录制下来,但许多人在讲座后找到我,他们告诉我非常喜欢那次讲座。因此,我决定重新录制并上传到 YouTube,那么,让我们开始吧,为大家带来“忙碌人士的大语言模型入门”系列,主讲人 Scott。好的,那我们开始吧。 LLM Inference 首先,什么是大语言模型 (Large Language Model) 呢?其实,一个大语言模型就是由两个文件组成的。在这个假设的目录中会有两个文件。 以 Llama 2 70B 模型为例,这是一个由 Meta AI 发布的大语言模型。这是 Llama 系列语言模型的第二代,也是该系列中参数最多的模型,达到了 700 亿。LAMA2 系列包括了多个不同规模的模型,70 亿,130 亿,340 亿,700 亿是最大的一个。 现在很多人喜欢这个模型,因为它可能是目前公开权重最强大的模型。Meta 发布了这款模型的权重、架构和相关论文,所以任何人都可以很轻松地使用这个模型。这与其他一些你可能熟悉的语言模型不同,例如,如果你正在使用 ChatGPT 或类似的东西,其架构并未公开,是 OpenAI 的产权,你只能通过网页界面使用,但你实际上没有访问那个模型的权限。 在这种情况下,Llama 2 70B 模型实际上就是你电脑上的两个文件:一个是存储参数的文件,另一个是运行这些参数的代码。这些参数是神经网络(即语言模型)的权重或参数。我们稍后会详细解释。因为这是一个拥有 700 亿参数的模型,每个参数占用两个字节,因此参数文件的大小为 140 GB,之所以是两个字节,是因为这是 float 16 类型的数据。 除了这些参数,还有一大堆神经网络的参数。你还需要一些能运行神经网络的代码,这些代码被包含在我们所说的运行文件中。这个运行文件可以是 C 语言或 Python,或任何其他编程语言编写的。它可以用任何语言编写,但 C 语言是一种非常简单的语言,只是举个例子。只需大约 500 行 C 语言代码,无需任何其他依赖,就能构建起神经网络架构,并且主要依靠一些参数来运行模型。所以只需要这两个文件。 你只需带上这两个文件和你的 MacBook,就拥有了一个完整的工具包。你不需要连接互联网或其他任何设备。你可以拿着这两个文件,编译你的 C 语言代码。你将得到一个可针对参数运行并与语言模型交互的二进制文件。 比如,你可以让它写一首关于 Scale AI 公司的诗,语言模型就会开始生成文本。在这种情况下,它会按照指示为你创作一首关于 Scale AI 的诗。之所以选用 Scale AI 作为例子,你会在整个演讲中看到,是因为我最初在 Scale AI 举办的活动上介绍过这个话题,所以演讲中会多次提到它,以便内容更具体。这就是我们如何运行模型的方式。只需要两个文件和一台 MacBook。 我在这里稍微有点作弊,因为这并不是在运行一个有 700 亿参数的模型,而是在运行一个有 70 亿参数的模型。一个有 700 亿参数的模型运行速度大约会慢 10 倍。但我想给你们展示一下文本生成的过程,让你们了解它是什么样子。所以运行模型并不需要很多东西。这是一个非常小的程序包,但是当我们需要获取那些参数时,计算的复杂性就真正显现出来了。 那么,这些参数从何而来,我们如何获得它们?因为无论 run.c 文件中的内容是什么,神经网络的架构和前向传播都是算法上明确且公开的。

宝玉

1,123,359 просмотров • 2 лет назад

把网站录下来给AI看, AI能照着做出来吗? 刚刚看到了个炫酷的灯具网站, 它有个功能是点击按钮直接能看到灯点亮的效果, 甚至网站的配色也会暗淡下来, 特别有氛围. 我突然想到, 这样的网站, 如果要让AI来做, 该怎么办? 把源代码拷给它? 用一个巨复杂的 prompt 来完成? 有没有可能, 我录个视频, 展示一下这个"关灯"的效果, 然后让AI来按照视频来写网站? 于是, 这个重任就交给了今天测试的模型, 百度刚出的文心-5.0-preview, 全模态大模型, 这个模型同时支持文本, 图片, 音频, 视频作为输入, 然后可以生成文本和图片, 所以我们这个测试可以最大化的利用它的能力. 我先录制了网站的效果, 然后写了prompt作为补充, 告诉它这个效果是怎样的, 以及准备的图片材料在哪里. 值得一提的是, 网站所展示的图片也是我用文心-5.0-preview生成的. 大家可以看视频中我生成的效果. 直接说测试结论: 目前每个模态都是可用的, 而且模态之间关联性非常好, 我测试了视频+文本, 图片+文本, 图片+语音, 都可以完成任务. 当然测试也发现了一些问题, 比如 token 输出速度不是特别快, 以及偶尔会有超时问题(已反馈给百度的同学). 我的使用建议是, 多利用它的多模态能力, 来完成之前不敢想象的任务, 它真的提升了使用场景的天花板. #文心大模型 #文心5 #百度 #文心一言 #ai教程

karminski-牙医

29,929 просмотров • 9 месяцев назад

Hermes Agent这样设置那么恭喜你为了省钱又进一步😂 deepseek为主大模型,kimi2.6为视觉模型,并且无需来回切换,只要丢图片进去就会自动使用kimi2.6去识别。(理论是你可以设置更多的大模型去完成不同的工作,并且全程自动无需切换大模型) 写很多以X文章的形式去编辑这类干货教程已经很多了,我想试试普通的发帖方式编辑会不会被更多的人去看到。 那么话不多说下面直接是干货! - 主模型:deepseek-v4-pro 视觉模型:kimi-k2.6 运作逻辑:deepseek 负责所有的工具调用、代码、排查、对话,一旦你丢过来图片或者视频帧,系统自动切到 kimi 去识图,识完把结果扔回给 deepseek 继续处理。整个过程不需要手动切换模型,你体感上就是同一个助手在干活,但实际上后面是两个大脑在协作。 - 为什么这样搭 deepseek-v4-pro 的工具调用和长上下文处理能力确实强,跑代码任务、排查问题、多步骤复杂操作的稳定性比 kimi 好一截。 但它有一个硬伤暂时不支持多模态,直接给它丢图片会报 unknown variant image_url 的错。 而 kimi-k2.6 的多模态能力不用说,中文 OCR 也准,但纯文本推理和工具调用不如 deepseek 稳。 所以最优解就是各取所长,deepseek 当大脑,kimi 当眼睛。 (其实说白了就是为了省Token!!!) - 配置步骤 第一步,确保 API Key 就位。在 `~/.hermes/.env` 里确认两行: ``` DEEPSEEK_API_KEY=你的deepseek密钥 KIMI_API_KEY=你的kimi密钥 ``` 第二步,切主模型,终端敲: ``` hermes config set model.default deepseek-v4-pro hermes config set model.provider deepseek ``` 第三步,设视觉模型: ``` hermes config set kimi-k2.6 hermes config set kimi-coding hermes config set ``` 第四步,如果你的 kimi key 是老 key(sk- 开头不是 sk-kimi- 开头),需要在 `.env` 最后加一行: ``` KIMI_BASE_URL= ``` 新 key 走 key 走 默认写的 是错的,不改会 401。 第五步,`/reset` 重开会话,生效。 - 踩过的坑 一个是上面说的 api 地址问题, 和 差一个字母,排查了好一阵。 另一个更隐蔽:Hermes 内置的 vision 工具往 kimi API 发请求时,content 数组里 image_url 排在了 text 前面,kimi 的接口不认这个顺序,偶尔 400。 目前的变通方案是发图时绕过内置工具,直接 Python 调 moonshot API,text 放 image_url 前面就没事。 不影响使用,但不算完美,等后续优化。 - 配完之后你正常跟他聊天就行,deepseek 处理一切。 发图过来的时候,你不需要说"用 kimi 看",系统自动检测到图片就走 kimi 视觉,识读完无缝回到 deepseek 继续对话。 你体感上就是同一个助手能看能想能干,但后台其实是两个模型在做各自最擅长的事。 这个方案的最大好处是不用你在聊天里手动切模型,流程全自动。而且以后如果想换视觉模型,改 ` 一行就行,不影响主模型。 - 兄弟们有哪个不懂的直接甩在评论区,狙击手会挨个解答!

DeFi狙击手 | Ai🕊️|Gate美股0费率

25,821 просмотров • 2 месяцев назад

Google的教学视频《Introduction to Large Language Models | 大语言模型介绍》(中英双语字幕) 这个视频介绍了大型语言模型(Large Language Models,LLMs)的概念、使用场景、提示调整以及Google的Gen AI开发工具。 大型语言模型是深度学习的一个子集,可以预训练并进行特定目的的微调。这些模型经过训练,可以解决诸如文本分类、问题回答、文档摘要、跨行业的文本生成等常见语言问题。然后,可以利用相对较小的领域数据集对这些模型进行定制,以解决零售、金融、娱乐等不同领域的特定问题。 大型语言模型的三个主要特征是:大型、通用性和预训练微调。"大型"既指训练数据集的巨大规模,也指参数的数量。"通用性"意味着这些模型足够解决常见问题。"预训练和微调"是指用大型数据集对大型语言模型进行一般性的预训练,然后用较小的数据集对其进行特定目的的微调。 使用大型语言模型的好处包括:一种模型可用于不同的任务;微调大型语言模型需要的领域训练数据较少;随着数据和参数的增加,大型语言模型的性能也在持续增长。 此外,视频还解释了传统编程、神经网络和生成模型的不同,以及预训练模型的LLM开发与传统的ML开发的区别。 在自然语言处理中,提示设计和提示工程是两个密切相关的概念,这两者都涉及创建清晰、简洁、富有信息的提示。视频中还提到了三种类型的大型语言模型:通用语言模型、指令调整模型和对话调整模型。每种模型都需要以不同的方式进行提示。 原始视频链接:

宝玉

114,706 просмотров • 3 лет назад