Loading video...

Video Failed to Load

Go Home

我成功做出了 第一个完全基于 BNB Chain 的链上AI元件,严格意义来叫 二值神经网络BNN。 经过训练,目前使用手写板随便写一个数字,它会进行真实推理,并给出它的推理过程和答案。它由34048个二值权重组成,并存在元件合约的Storage里。通过256 位输入由128 个神经元推理出10 个类别得分,最后取最大值作为推理结果。训练数据集是 5,620 张真人手图,按固定种子切成 4496训练 / 1124测试,测试推理准确率 93.15%。 它目前是一个用于测试元件的合约,后面会不断迭代更多测试用例。测试合约地址:0x2F556D77D8911A12512d209c47d51FD9dF090c1C

40,991 views • 18 days ago •via X (Twitter)

0 Comments

No comments available

Comments from the original post will appear here

Related Videos

这两天看到的收获很大的一篇论文《AlphaCodium:引领代码生成新境界,从提示工程到流程工程》,它提出了一种新的生成代码的方法,比传统的直接基于Prompt生成代码的方式准确率更高。 它用的测试集是CodeContests ,这是由 Deepmind 推出的一项挑战性编程数据集。相对来说还是很权威的。以 GPT-4 为例的话,准确率从19%提升到了44%。 它的原理有些复杂,但是如果你有过LeetCode刷题经验,相对比较好理解一些。 普通人刷 LeetCode,上来就做,这样有可能得到答案,也有可能做不出来,这就类似于你把题目直接丢给GPT-4,让它直接给出答案,准确率相对要低一些。 高手刷LeetCode,会有个做题的流程,同样的水平,做出来的概率会大一些。 高手做题时会大概分成几个步骤: 1. 先把题目中的要点一条条列出来,确保不会遗漏任何重要信息 2. 通常LeetCode会提供 1 个或多个测试用例,仔细看测试用例,分析为什么给定的输入能得到给定的输出 3. 在写代码前,列出几种可能的解决方案,例如暴力算法、递归、动态规划,每一种方案写下思路和伪代码 4. 对于列出来的几种方案进行评估,选出最佳方案 5. 可能还会补充一些测试用例帮助事后验证 --- 以下部分是迭代过程: 6. 根据选中的解决方案写代码,如果代码不能运行则修改代码直至能运行 7. 将代码提交到LeetCode的测试集去验证,如果无法通过所有测试,则修改错误,如果通过到第8步 8. 用第 5 步生成的测试用例验证代码,如果运行不通过则继续优化代码 这里留个思考题:如果第8步出错,怎么判断是代码有问题还是自己生成的测试用例有问题? 而 AlphaCodium 就是完美遵循了以上的步骤来解题,只不过每一步都是由大语言模型帮助完成! 这给了我一些启示: 1. 不必寄希望于将复杂的任务在一个 Prompt 中完成,拆分成若干子任务成功概率会高一些 2. AI 可以借鉴人类的优秀实践,例如高手是如何解决编程难题的,让 AI 按照高手的步骤去一步步做 3. AI 的潜力还有很大挖掘空间 完整的文章参考: 中文译文:

宝玉

265,105 views • 2 years ago

我基于 BNB Chain ,实现了历史上第一次在L1主网上跑Linux。这是第一个每条指令都由 L1 主网交易执行、全部状态都存在 L1 上的 Linux。 此前这个领域公认的先行者是 Cartesi:它的 RISC-V 虚拟机能启动完整的 Linux,但 Linux 是在链下节点上跑的,以太坊 L1 只负责结算,只有当参与者对结果有争议时,才把争议的那一步拿到链上重算。正常情况下,L1 从头到尾没有执行过一条 Linux 指令。它是 L2 框架,靠欺诈证明和至少一个诚实的挑战者。 而TapeOut做的是真正的,Linux 的每一条指令都在 BNBChain 主网的交易里由验证者算出来,并且拥有32 个寄存器、全部 CSR以及16 MB 内存的每一页都在BNBChain主网上,没有任何链下执行。也就是说Cartesi 上让 L1 能验证 Linux,我们让BNBChain 真实的链上运行完整的 Linux。 它是由TapeOut 的电路+容器组成,第一次组成了一台完整的链上计算机。一片电路(#4246)开通了容器,容器成了这台机器的主人,谁持有这片电路的 NFT,谁就是它的管理员。CPU 是一个 RISC-V 元件,内存是 16 MB、按 1 KB 分页的 16,384 个页合约,写时复制。主板合约用交易跑指令,把改过的内存页写回链上,把串口输出发成事件。 装的是 kernelorg 主线 Linux 6.5.12,它从复位向量 0x80000000 上电,在主网上安拍跑完整个内核启动,直到 root 登录:一共44,988 拍,9,000 余笔交易(花了我好多bnb啊,有点肉疼,另外我还找bnbchain的小伙伴申请了10个tBNB做的测试网测试,感谢 Sandy 帮助协调测试网的tBNB)。 另外呢,任何人都可以用它。打开 -a 会告诉你这是 riscv32 上的 Linux 6.5.12;factor 1000000007 在链上做一次质因数分解;echo 写一个文件,这个文件就住在主网上某一页合约的字节码里,你能在 BscScan 上看见它,谁使用谁自己付 gas(我可支付不起这么多人测试,哈哈)。 这件事说明: BNB Chain 不只是一个公共账本,它可以基于TapeOut承载可验证的生产工具,一台计算机是所有生产工具的底座。 接下来:用门级 RISC-V 核做这台机器的裁判,让每一条指令都有晶体管级的定义;让 Linux 能直接读链上数据;让更多电路拥有自己的不同类型的机器。BNB Chain 的延展性比大多数人想象的大得多,TapeOut在为此全力以赴。 测试用例: CZ 🔶 BNB Yi He BNB Chain Four.meme-華語

Blonskr

106,911 views • 2 days ago

一个中国开发者花了三天测试本地 AI 硬件——Mac Mini 16G 对战 RTX 4070Ti。他把结果发到 B 站,结论是:正经跑代理工作流,至少需要 2,800 美元的硬件。 看起来像真活。一边 Mac Mini,一边 4070Ti,双双发烫,图表并排跑。他最后甩出一个数字:想在家里正经搞 AI,至少得花 2,800 美元。 兄弟,停在 0:20 秒。看他手悬停的那个 Ollama 窗口,再看它背后终端日志里的时间戳。 那些时间戳不是隔了三天——它们只差 27 分钟。 “三天”是代理跑的。“27 分钟”是他本人跑的。 一个 Claude 代理在 27 分钟 内跑完了所有测试:Mac Mini 测、4070Ti 测、工具集成检查。代理写了脚本,代理生成了截图里的时间戳,代理生成了“三天”这个叙事——因为 B 站的科技区喜欢看得见的努力。 有人扒了上传元数据:视频是在第一个终端打开后的 31 分钟 上传的。还有人把截图和 GitHub 上公开的 Mac Mini 测试脚本做了对比——除了屏幕上那只手,其他全是代理生成的。 六个月前,深圳一个 14 岁小孩把一个 AI 代理推到了 GitHub。评委说:没有实际应用价值。3,100 次 fork 之后。这个开发者是其中之一。他在接不到咨询客户的那一周,就把代理接入了自己的内容流水线。 他从 2019 年就是 B 站科技 up 主。最好的一期视频,做了三个月。现在代理做他以前需要 27 分钟才能干完的活。他仍然出镜——因为观众要看那双手。 他想告诉观众关于本地 AI 硬件的真相。却不小心让大家看到了——屏幕上唯一一个代理生成不了的东西。

CAT

42,457 views • 3 months ago

非常好的一个演示视频,通过可视化清晰的介绍了 LLM 的核心 Transformer 架构的原理。 包括词嵌入、自注意力机制等关键技术。对了解GPT-3等大型语言模型的内部结构很有帮助。 👇下面是文字版本: GPT的全称及其含义 GPT是Generative Pre-trained Transformer的缩写。其中,"Generative"表示这个模型是用来生成新文本的;"Pre-trained"意味着模型是在大量数据上预先训练好的;"Transformer"则指代一种特定类型的神经网络结构。因此,GPT本质上是一个基于Transformer架构、经过预训练、能够生成文本的语言模型。 Transformer的定义及其在AI领域的应用 Transformer是一种专门处理序列数据的神经网络架构。它最初是为机器翻译任务设计的,但后来被发现在其他许多NLP任务上也有出色表现,如语言建模、命名实体识别等。除了NLP,Transformer也被应用于语音识别、图像字幕生成等领域。Transformer的成功很大程度上归因于其独特的自注意力机制,使其能够高效地处理长程依赖关系。 Transformer的工作原理简介 Transformer的工作流程可以概括为三个主要步骤:首先,将输入的文本序列转化为一组向量表示;然后,通过自注意力机制和前馈神经网络对这些向量进行变换和更新;最后,根据更新后的向量生成输出分布,用于预测下一个词。整个过程中,自注意力机制起到了关键作用,使得模型能够动态地确定输入序列中每个位置与其他位置之间的相关性,从而更好地捕捉上下文信息。 Transformer处理文本信息的过程 当Transformer处理一段文本时,首先需要将其分割成一个个基本单元,如单词或子词,这些基本单元被称为"token"。接着,每个token都会被映射为一个高维向量,即"词嵌入"。这一步旨在将离散的文本符号转化为连续的向量表示,以便神经网络进行处理。然后,这些词向量会通过多个编码器层进行变换和更新,每一层都会综合考虑当前token与其他token之间的关系,从而使每个向量都融入了上下文信息。最后,解码器根据编码器的输出和之前生成的token,预测出下一个最可能的token。通过不断重复这一过程,Transformer就可以生成连贯的文本片段。 词嵌入(Word Embedding)的概念和作用 词嵌入是一种将词映射到高维向量空间的技术。通过词嵌入,每个词都被表示为一个实数向量,这个向量捕捉了该词的语义信息。词嵌入的一个重要特性是,语义相似的词往往在向量空间中距离较近。例如,"king"和"queen"这两个词的向量之间的距离会比"king"和"apple"的距离更近。此外,词嵌入还能够反映词之间的类比关系,如"king"-"man"+"woman"的结果会接近"queen"。词嵌入为神经网络提供了一种处理文本数据的有效方式,使其能够利用词语之间的语义关系进行推理和预测。 深度学习模型的基本结构和特点 深度学习模型通常由多个层组成,每一层对输入数据进行一定的变换,并将结果传递给下一层。层与层之间的连接通常是通过矩阵乘法实现的,其中矩阵的元素就是模型的参数。这些参数在训练过程中会不断更新,以使模型的输出与期望输出尽可能接近。深度学习模型的训练通常采用反向传播算法,即根据输出的误差,逐层调整参数的值。通过多次迭代,模型可以逐渐学习到数据中的规律和模式。深度学习模型的一个显著特点是,它们可以自动学习数据的表示方式,而无需人工设计特征。这使得深度学习在处理图像、语音等复杂数据时表现出色。 Softmax函数的作用和计算过程 Softmax函数常用于深度学习模型的输出层,特别是在多分类问题中。它的作用是将一组实数转化为一个概率分布,使得每个类别都有一个0到1之间的概率值,并且所有类别的概率之和为1。Softmax函数的计算过程分为两步:首先,对每个输入值取指数;然后,将每个指数值除以所有指数值的和。这样得到的结果就是一个合法的概率分布。Softmax函数有一个很好的性质,即输入值较大的类别会获得较高的概率,而输入值较小的类别的概率会趋近于0。这使得模型的输出更容易解释,并且有利于进行决策和预测。 生成模型预测下一个词的过程 当生成模型(如GPT)预测下一个词时,通常采用以下步骤:首先,根据前面已经生成的词,模型会计算出每个可能的下一个词的概率。这个概率分布反映了模型对不同词的偏好程度。然后,从这个分布中采样出一个词作为新生成的内容。接下来,模型将这个新词加入到已生成的序列中,并重复上述过程,直到达到预设的长度或遇到终止条件(如句号)为止。通过这种不断预测和采样的方式,生成模型可以创作出连贯而富有创意的文本。值得注意的是,为了提高生成文本的多样性和自然度,可以引入"temperature"等超参数来调节输出分布的形状。 GPT-3的参数量和嵌入矩阵 GPT-3是目前最大的语言模型之一,其参数量高达1750亿。这意味着,模型需要学习和存储大量的权重值,以刻画自然语言中的规律和模式。GPT-3的一个重要组成部分是嵌入矩阵(embedding matrix),它负责将每个词映射为一个高维向量。在GPT-3中,嵌入矩阵的大小为50257×12288,即词表中共有50257个不同的词(或子词),每个词被映射为一个12288维的向量。嵌入矩阵中的每个元素都是一个可学习的参数,在训练过程中会不断更新,以使得语义相似的词具有相近的向量表示。GPT-3庞大的参数量使其能够学习到比以往模型更加细致入微的语言知识,这也是其在各种NLP任务上表现出众的原因之一。 模型训练中的"Temperature"超参数 在生成模型的训练过程中,"Temperature"是一个重要的超参数,它控制着输出分布的形状。具体来说,temperature值越高,输出分布就越平缓,生成的结果也就越多样化;反之,temperature值越低,输出分布就越尖锐,生成的结果也就越保守。合适的temperature值可以在确保生成内容连贯性的同时,提高其丰富性和创造性。例如,当temperature值接近于0时,模型会倾向于选择概率最高的那个词,导致生成的文本可能流于老套;而当temperature值较高时,模型会给予概率较低的词更多机会,从而产生更加新颖和意想不到的结果。在实践中,temperature值通常需要根据具体任务和需求进行调整,以达到理想的平衡。

歸藏(guizang.ai)

52,216 views • 2 years ago

给大家带来 MiniMax-M3 实测! 本次测试包含了复杂前端, 后端 Agentic Coding, Agent 能力测试, 以及我的使用经验总结. 来看结论: 前端能力上, 可以完全适配 KCORES2026p2 的前端测试题目, 无论是空间理解, 建模精确度, 场景美学都十分在线, 其中我最满意的是美学部分, 它的颜色运用非常好. 不足的地方主要体现在复杂需求不能一次性写对(比如光追引擎), 需要迭代一下就可以了. 后端能力测试这次也是突飞猛进, 得分超过了 deepseek-v4-pro 和其他一众国产大模型, 略逊于 GPT-5.4-Pro(xhigh). Agent 能力上表现同样亮眼, 达成了榜单第二的接单量, 证明它的规划能力特别强。 下面是我在测试和实际使用中, 总结出来的 M3 使用经验, 供大家参考: 我的体感是 M3 特别喜欢推理, 它可以单次执行超长的推理. 在咱们的这些前端测试中, 它最长的输出甚至达到了我规定的 64k token上限, 所以, 不要上来就写一个超级复杂的 prompt 让它执行, 而是需要先把需求形成 plan, 然后让 agent 蜂群去执行, 这样才能得到理想的效果, 所以 M3 先天适合放在带 plan 模式的 Coding Agent 中使用. 如果把它嵌入到 Agent 框架中使用, 那么 prompt 编排就一定要做好, 不要一股脑把大量的 tool call 或者超大的 system prompt 丢给它. 还是需要下功夫好好编排一下的. 本次 M3 相比之前的 2.7 版本有了大幅度的提升, 模型偏好上来看, M3 是一个规划能力极强的模型, 所以特别适合用在一些规划性质的 Agent 框架中, 比如任务拆分, 日程管理, 流程设计等. 而本次暴露出来的不足则是执行过程中约束不够强, 比如 prompt 中设置的复杂规则, 一定要增加代码级别的 harness 闭环流程来进行约束, 而不能只靠模型本身来管理自己的行为. #minimaxm3 #minimax #agenticcoding #aiagent #harness

karminski-牙医

18,950 views • 3 months ago

Qwen3-Next-80B-A3B 实测! 能跟头部模型对打吗? 直接说结论, 能完成我这个大象牙膏测试的一部分, 已经很厉害了, Python 杯子倒水那个测试表现也可圈可点. 来看测试中暴露出来的问题: 首先这个模型生成的样式特别多变, 可以看测试中生成的前端页面的样式和布局, 几乎每次都不一样. 所以实际使用中, 可能会存在稳定性的问题, 建议 prompt 中多做约束, 避免模型过度发挥. 不过这并不全是坏处, 如果拿这个大模型写文, 反而可能会超常发挥, 每次写出来的东西都不一样, 不会呆板. 另外目前发现最大的问题是, 给到模型一大堆数据, 让模型整理一个网页, 结果模型偷懒了, 直接把代码和数据省略掉了, 这个应该还是 GPT-4 时代的问题 (24年上半年) 出现了. 这里猜测可能是高稀疏性专家混合模型或者多词元预测造成的问题, 这两个都会在生成中选择最经济的生成模式, 因此可能会倾向于生成"此处代码省略"这样的代码来替代原本要生成一大堆代码的场景. 召回倒是没太大问题, 鞭炮连锁爆炸那个测试, 虽然模型没有成功写出来, 但是最长的一次还是生成了1100行代码, 我仔细看了下, 基本都考虑到了我 prompt 中要求的逻辑, 只不过实现的代码有 bug 跑不起来而已. 综合来讲, 我觉得这应该是 100B 以内的模型无敌手了, 考虑到定位可能是个新的技术试验模型, 所以期待千问推出更大规模 (例如400B-A15B) 的模型, 带来更好的性能. 测试 prompt: #Qwen3Next #大模型竞技场 #Qwen3

karminski-牙医

30,709 views • 1 year ago