Загрузка видео...

Не удалось загрузить видео

На главную

今天推荐 PocketPal —— 一款能在 iPhone / Android 设备运行大模型的 App。 首次使用 App 时,需从内置库中下载模型 (推荐阿里 Qwen2.5-3B),之后便能离线运行。 在我 iPhone 14 Pro Max 上可调用苹果 Metal API,生成速度约为 11 token/s。 可惜 Qwen2.5 还不知道“数码荔枝”是谁...是我们的问题。

71,616 просмотров • 1 год назад •via X (Twitter)

Комментарии: 12

Фото профиля 数码荔枝
数码荔枝1 год назад

PocketPal 开源免费 • Github: • App Store: • Google Play:

Фото профиля Reown
Reown1 год назад

AppKit is the full-stack toolkit to build onchain app UX 🪄 ✅ Social, Email, and Wallet Login ✅ Embedded Wallets ✅ Crypto Swaps ✅ On-ramp Integrate with just 20 lines of code across 10+ languages for all EVM chains and Solana. Onboard millions of users for free today.

Фото профиля emperinter
emperinter1 год назад

🤡 要不试一下“荔枝数码”?

Фото профиля 数码荔枝
数码荔枝1 год назад

啊,你别逼我~~~

Фото профиля Jerlin
Jerlin1 год назад

救命哈哈哈哈哈哈

Фото профиля 数码荔枝
数码荔枝1 год назад

上市了,我赖某也出息了一把。

Фото профиля 三秋十李 Sergio
三秋十李 Sergio1 год назад

最近这种移动端可加载大模型的App如雨后春笋冒了出来 昨天刚装了一个fullmoon,今天就有更好的了

Фото профиля 数码荔枝
数码荔枝1 год назад

主要还是大模型资源占用优化的好,太牛了

Фото профиля 洋务运动总司令
洋务运动总司令1 год назад

啥意义呢,云服务免费速度又快

Фото профиля BryceWG
BryceWG1 год назад

算力调用感觉有问题,安卓8g3速度只有8tps左右,感觉只用了cpu

Фото профиля 吕靖
吕靖1 год назад

曾经使用过,体验并不好

Фото профиля 数码荔枝
数码荔枝1 год назад

你是指这个 App 还是 Qwen2.5? 如果你说的是这个 App 的话,确实他缺失了很多类似工具的基础功能,比如,没办法预设提示词... 所以每次开启新的对话时,都需要手动输入一次。

Похожие видео

发现一个讲的很细的大语言模型微调教程,详细介绍了整个流程,包括数据准备、参数设置、资源监控等关键步骤。 基本没有技术能力也可以完成微调。想要了解 LLM 原理的可以按这个实践一下。 时间轴: 0:00 概念概览 3:02 自定义数据的准备 8:17 微调操作演示(T4 版本) 16:52 微调操作演示(A100 版本) 19:13 在 Hugging Face 上的保存与使用方法 文字版整理: ✲ 如何使用自己的数据对大语言模型进行微调(fine-tuning): 对大语言模型进行微调并不一定非常困难和昂贵。通过使用自己的数据集对预训练模型进行微调,可以让模型更好地适应特定的任务需求。微调过程能够在保留原模型语言理解能力的基础上,进一步提升其在特定领域或任务上的表现。 ✲ 使用Hugging Face模型库和Unslaw工具进行模型微调: Hugging Face提供了丰富的预训练语言模型资源,用户可以根据任务需求选择合适的模型作为基础进行微调。而Unslaw工具则提供了一套简单高效的微调流程,其优点包括出色的内存使用效率以及对扩展上下文窗口的支持。通过Unslaw,用户能够以较低的资源开销完成模型微调。 ✲ 在Google Colab上使用免费/付费GPU资源进行微调: Google Colab提供了免费和付费的GPU资源,用户可以根据任务的复杂程度选择使用T4或A100。对于大多数微调任务而言,免费的T4资源已经足够。但如果数据集较大或模型较为复杂,升级到A100可以获得更充裕的算力支持。Colab为用户提供了一个易于上手的模型微调环境。 ✲ 准备自定义的微调数据集: 准备微调数据的过程并不复杂。用户可以直接使用纯文本文件作为数据来源,而无需进行额外的预处理。为了获得理想的微调效果,建议至少准备100-200个样本。在示例中,为了快速演示,仅使用了几个样本。通过一个简单的Python脚本,可以方便地将原始文本数据转换为微调所需的JSON格式。 ✲ 修改Colab笔记本中的参数设置: 在Colab笔记本中,需要根据实际情况调整一些参数。例如,可以根据数据集的token数量来设置max_sequence_length参数,借助rope scaling技术,模型能够支持任意长度的上下文。此外,还可以选择使用Instruct系列模型作为base model,直接在其基础上进行指令微调。为了节省资源,可以启用4-bit量化。同时,参考Q-Lora论文的建议,调整R值和alpha值,以在资源占用和模型质量之间取得平衡。 ✲ 训练过程中的资源使用监控: 在模型训练过程中,用户可以通过Colab的资源监控选项卡实时观察GPU、内存和硬盘的使用情况。如果发现资源不足,可以考虑从T4升级到A100。通过监控资源占用,用户能够及时调整配置,确保微调任务稳定高效地进行。 ✲ 模型训练的loss变化和最佳checkpoint的选择: 通过记录不同训练步数下的loss值,可以判断模型的收敛情况。理想的做法是选择loss下降曲线趋于平缓的点作为最佳checkpoint,这样既能充分训练模型,又能避免过拟合。为了事后方便筛选,可以设置每隔一定步数保存一次checkpoint。 ✲ 模型微调完成后的保存与使用: 微调完成后,可以选择只保存adapter layers以加快保存速度。但更推荐的做法是保存完整模型,并使用float16精度,这样可以得到一个更通用和标准的模型格式,方便后续的部署和使用。 ✲ 在Hugging Face上公开或私有发布微调后的模型: 用户可以选择在Hugging Face的模型库中公开或私有地发布自己微调后的模型。发布之前,需要在Hugging Face账号中创建一个访问令牌,并在发布时提供相应的用户名和令牌信息。通过在Hugging Face上发布模型,用户可以方便地与他人分享自己的微调成果。 ✲ 使用微调后的模型进行推理(inference): 在使用微调后的模型进行推理时,首先需要加载保存的模型。接着,使用tokenizer对输入的文本进行处理,并将其传入模型。进行推理时,max_length参数需要与训练时保持一致,以确保生成的结果不会被截断。完成以上步骤后,就可以利用微调后的模型进行各种实际应用了。

歸藏(guizang.ai)

61,931 просмотров • 2 лет назад

OpenAI 的大神 Andrej Karpathy 前几天在他的 YouTube 频道讲了一堂课,系统的介绍了大语言模型,内容深入浅出,非常赞,抽空将它翻译成了双语,由于内容较长,我将分批上传,以下是第一部分精校后的双语视频,字幕文稿如下: Intro: Large Language Model (LLM) talk 大家好。最近,我进行了一场关于大语言模型的 30 分钟入门讲座。遗憾的是,这次讲座没有被录制下来,但许多人在讲座后找到我,他们告诉我非常喜欢那次讲座。因此,我决定重新录制并上传到 YouTube,那么,让我们开始吧,为大家带来“忙碌人士的大语言模型入门”系列,主讲人 Scott。好的,那我们开始吧。 LLM Inference 首先,什么是大语言模型 (Large Language Model) 呢?其实,一个大语言模型就是由两个文件组成的。在这个假设的目录中会有两个文件。 以 Llama 2 70B 模型为例,这是一个由 Meta AI 发布的大语言模型。这是 Llama 系列语言模型的第二代,也是该系列中参数最多的模型,达到了 700 亿。LAMA2 系列包括了多个不同规模的模型,70 亿,130 亿,340 亿,700 亿是最大的一个。 现在很多人喜欢这个模型,因为它可能是目前公开权重最强大的模型。Meta 发布了这款模型的权重、架构和相关论文,所以任何人都可以很轻松地使用这个模型。这与其他一些你可能熟悉的语言模型不同,例如,如果你正在使用 ChatGPT 或类似的东西,其架构并未公开,是 OpenAI 的产权,你只能通过网页界面使用,但你实际上没有访问那个模型的权限。 在这种情况下,Llama 2 70B 模型实际上就是你电脑上的两个文件:一个是存储参数的文件,另一个是运行这些参数的代码。这些参数是神经网络(即语言模型)的权重或参数。我们稍后会详细解释。因为这是一个拥有 700 亿参数的模型,每个参数占用两个字节,因此参数文件的大小为 140 GB,之所以是两个字节,是因为这是 float 16 类型的数据。 除了这些参数,还有一大堆神经网络的参数。你还需要一些能运行神经网络的代码,这些代码被包含在我们所说的运行文件中。这个运行文件可以是 C 语言或 Python,或任何其他编程语言编写的。它可以用任何语言编写,但 C 语言是一种非常简单的语言,只是举个例子。只需大约 500 行 C 语言代码,无需任何其他依赖,就能构建起神经网络架构,并且主要依靠一些参数来运行模型。所以只需要这两个文件。 你只需带上这两个文件和你的 MacBook,就拥有了一个完整的工具包。你不需要连接互联网或其他任何设备。你可以拿着这两个文件,编译你的 C 语言代码。你将得到一个可针对参数运行并与语言模型交互的二进制文件。 比如,你可以让它写一首关于 Scale AI 公司的诗,语言模型就会开始生成文本。在这种情况下,它会按照指示为你创作一首关于 Scale AI 的诗。之所以选用 Scale AI 作为例子,你会在整个演讲中看到,是因为我最初在 Scale AI 举办的活动上介绍过这个话题,所以演讲中会多次提到它,以便内容更具体。这就是我们如何运行模型的方式。只需要两个文件和一台 MacBook。 我在这里稍微有点作弊,因为这并不是在运行一个有 700 亿参数的模型,而是在运行一个有 70 亿参数的模型。一个有 700 亿参数的模型运行速度大约会慢 10 倍。但我想给你们展示一下文本生成的过程,让你们了解它是什么样子。所以运行模型并不需要很多东西。这是一个非常小的程序包,但是当我们需要获取那些参数时,计算的复杂性就真正显现出来了。 那么,这些参数从何而来,我们如何获得它们?因为无论 run.c 文件中的内容是什么,神经网络的架构和前向传播都是算法上明确且公开的。

宝玉

1,123,359 просмотров • 2 лет назад

今天好郁闷,发生了一点不愉快的事情!人生第一次为了自己的愚蠢进了叔所! 期待明天的好结果!!! ⸻ AI 的下一关,不在能力,而在可被证明 在模型规模不断被刷新纪录的阶段,有一个问题始终被刻意回避: AI 的结论,是否真的来自它声称的计算过程? Inference Labs 选择从这个问题切入。 他们关注的不是模型性能,而是推理行为本身是否可信、是否可复现、是否可审计。 Proof of Inference 的意义,在于把“我相信模型没问题”变成“模型必须给出证明”。 通过零知识证明,系统可以在不暴露模型结构和参数的前提下,确认一次推理: •确实由指定模型完成 •计算过程未被替换或篡改 •输出结果与真实推理一致 这不是提高透明度,而是引入约束。 在工程层面,DSperse 做的事情同样关键。 它把原本高度定制化、专家依赖的 zkML 开发流程,拆解为可复用组件, 使“可验证 AI”从研究范畴,进入实际应用范畴。 否则,再正确的理念也只能停留在白皮书。 目前,可验证推理在性能上的代价仍然明显, 但这更像早期加密系统的计算成本问题,而不是路线错误。 融资的用途,也正是针对这一层进行系统级优化。 如果说过去的 AI 竞争是“谁能算得更快”, 接下来的竞争,很可能是: 谁的推理能被证明、被追溯、被承担责任。 Inference Labs 所搭建的,不是价值观, 而是一层让 AI 输出进入现实系统所必需的验证基础设施。 #KaitoYap Kaito AI 🌊 #Yap Inference Labs

董小姐 |上Gate玩事件合约

303,919 просмотров • 7 месяцев назад

我用一台24GB Mac,实现了“Token自由” 最近,我在一台24GB内存的M4 Mac mini上,本地部署了Qwen3.8-27B。 不是缩水版,也不是调用云端API,而是: 😎Qwen3.8-27B完整模型 ☑️MLX 4-bit量化 ☑️MTP推测解码加速 ☑️支持文字、图片和思考模式 ☑️提供OpenAI兼容接口 ☑️所有对话完全在本机完成 这套模型的主体大约15GB,MTP草稿模型约256MB,实际运行峰值内存约18.17GB。 也就是说,一台24GB的Apple Silicon Mac,确实可以把27B级别的多模态模型装进口袋里。 / 我把上下文设置为8K、并发设置为1,并启用了MTP block size 3。在这台M4 Mac mini上的实测结果是: 普通短回答约4.12 token/s MTP接受率较高时接近9.94 token/s 1:文字对话正常 2:图片识别正常 3:思考模式正常 模型启动大约需要6~8秒 它当然没有小模型那么快,也比不上云端服务器集群。 但它有一个非常重要的优势:不再按Token付费。 模型下载完成以后,即使断开网络也能继续运行。聊天记录、图片、文件和提示词都不需要离开自己的电脑。 可以用它做翻译、总结、写作、代码分析、资料整理,也可以通过OpenAI兼容接口接入自己的工作流。 浏览器只是一个聊天界面,并不是必需的。终端、桌面客户端或者自己编写的程序,都可以直接调用这个本地模型。 我给它分配了独立目录、独立Python环境和独立端口,我主要为了千问和电脑里原有的百灵模型共存。 只是24GB内存不适合同时加载两套大模型,使用时切换即可,不会影响原有模型文件。 #Token自由 #Qwen #MLX #MTP #AppleSilicon #MacMini #本地大模型 #AI部署

DeFi狙击手 | Ai🕊️

30,119 просмотров • 2 дней назад