Leonard's banner
Leonard's profile picture

Leonard

@Leoskie_L • 11,144 subscribers

AI Semi & Supply Chain | Warsaw × Taiwan Physical layer | US demand ↔ TW supply 100% incremental GM from depreciation expiry Not advice • Just physics.

Videos

Leoskie_L's profile picture

SanDisk CTO Alper Ilkbahar 在 Investor Day 放出了一個我認為比「HBF 有多快」更值得看的數字: 4 張 HBF GPU,可以做到 8 張 HBM GPU 的 token output。 表面上看,很容易把它理解成「HBF 讓 GPU 性能提升 2 倍」。 但我覺得這樣理解反而低估了這個 demo。 因為 HBF 真正解掉的東西,不是算力,而是現在 AI inference 裡一個越來越昂貴的問題: 很多時候,我們買更多 GPU,不是因為缺 FLOPS,而是因為模型塞不進去。 SanDisk 的模擬很直接。 他們先拿一顆類似目前市場主流高階 GPU 的架構,每張 GPU 配 192GB HBM。然後做第二個版本,把 HBM 全部換成 HBF,讓單張 GPU 的 near-compute memory 從 192GB 拉到大約 4TB。 這個 4TB 其實也和現在公開的 HBF 架構方向對得上。SanDisk 與 SK hynix 最新公布的第一版開放 HBF 規格,單個 HBF stack 最高 512GB;如果一顆 accelerator 配八組,就是大約 4TB。HBF 的目標 bandwidth 則分成約 0.4TB/s 到 3TB/s 三個等級。 接著他們跑一個模擬的 agentic coding workload:AI agent 不斷寫 code、產生新任務、讀取上下文,再繼續工作,底層是一個接近 490B 級別的 Qwen3 模型。 這類 workload 很有意思,因為它不是一次問答就結束。 Agent 活得越久,context 越長,KV cache 越大,同時還要把巨大的 model weights 放在離 GPU 足夠近的位置。Qwen 官方公開的 Qwen3-Coder-480B 本身就是 480B total parameters、35B active parameters,而且原生 context 已經做到 256K。 所以當 SanDisk 把它丟進只有 192GB HBM 的 GPU 時,第一個問題根本還不是 GPU 算得快不快。 第一個問題是:放不下。 按照他們的模擬,HBM 系統至少需要 8 張 GPU 才能開始跑這個 workload。 注意這裡的「8」。 這八張 GPU 並不是因為模型需要八張 GPU 的 compute 才算得動,而是 memory capacity 逼你先買八張 GPU。 你本來可能只需要其中一部分算力,但為了取得綁在 GPU 上面的 HBM capacity,只能把 GPU 一起買回家。 這就是我會稱它為 GPU memory tax 的地方。 GPU 現在其實同時賣給你兩樣東西:compute 和 memory capacity。但 AI inference 對這兩樣東西的需求成長速度並不一定一致。 你可能缺 1TB memory,卻沒有缺對應那麼多 FP8 FLOPS。 可是 HBM 又焊在 accelerator package 上。 於是缺 memory 的解法變成:買更多 GPU。 這才是 SanDisk 這個 demo 真正想拆掉的東西。 把同樣架構換成大約 4TB HBF 之後,一張 GPU 就已經可以把整個 workload 裝進去。 一張 HBF GPU 當然沒有八張 HBM GPU 快,SanDisk 自己也沒有假裝它會比較快。 但事情到這裡已經完全變了。 因為以前你的「minimum viable system」是八張 GPU;現在 minimum viable system 變成了一張。 然後 SanDisk 再把 HBF GPU 加到四張。 結果: 4 HBF GPU ≈ 8 HBM GPU 的 token output。 這裡才出現所謂的「2× performance per GPU」。 但我要特別強調: 這不是 HBF 的 NAND cell 比 HBM DRAM 快兩倍。 也不是同一顆 GPU 換上 HBF 之後 matrix multiplication 突然快兩倍。 真正發生的是,memory capacity 改變了 workload 怎麼被切割。 原本八張 HBM GPU 必須共同承擔一個巨大的 memory footprint,模型被迫跨 GPU 分散,GPU 之間還需要搬資料、同步、做 tensor/model parallel。 HBF 把單 GPU memory pool 拉到 TB 級之後,很多原本為了「塞下模型」而存在的 GPU partitioning 可以被拿掉。 GPU 終於比較像是在買 compute,而不是買昂貴的 HBM 擴充卡。 所以我反而會把 SanDisk 的數字寫成: HBF 沒有讓一張 GPU 算得快兩倍;它讓同樣的 inference throughput,只需要一半的 GPU。 這兩句話看起來很像,經濟意義卻完全不同。 前者是一個 memory benchmark。 後者是在談 AI Factory 的資本效率。 如果四張 accelerator 可以完成過去八張 accelerator 的工作,那被影響的就不只是 memory BOM。 GPU 數量、server 數量、NVLink / scale-up fabric、NIC、switch、power delivery、液冷、機櫃空間,甚至整個 data center 的 MW / token 都可能一起往下走。 這也是為什麼 SanDisk 現在一直講 token economics,而不只是 NAND ASP。官方在最新 HBF 規格公告裡,也把目標直接寫成改善 inference 的 power、performance 與 total cost of ownership。 而對我來說,這才是 HBF 對 SNDK 最大的想像空間。 以前 NAND 在 AI infrastructure 裡的位置很清楚: GPU → HBM → DRAM → SSD → storage。 離 compute 越遠,價值密度越低。 SanDisk 現在想做的,其實是在這個 hierarchy 裡硬插一層: GPU → HBM / HBF → DRAM / SSD。 SK hynix 自己也直接把 HBF 定義成位於 HBM 與 SSD 之間的新 memory layer,而 SanDisk 的 OCP 規格更明確談到 HBF 與 HBM 可以 coexist。 這點很重要。 我不認為最合理的 bull case 是: HBF 把 HBM 幹掉。 HBM 的 latency、write characteristics,以及真正需要極低延遲反覆讀寫的 hot data,依然有很強的物理優勢。 更合理的架構反而可能是: 最熱的 activation、KV cache 留在 HBM; 大量 model weights、較冷的 KV、agent state,以及那些「需要非常大容量、但不需要每一個 byte 都享受 HBM latency」的東西,逐漸搬到 HBF。 這樣反而更麻煩。 因為如果 HBF 真的成立,SanDisk 搶的並不只是 SSD 裡面多幾顆 NAND。 它是在嘗試讓 NAND 向 compute 靠近一層。 從 storage media,變成 accelerator architecture 裡的一部分。 這會直接改變 NAND 的價值量。 不過現在也不能把這張 simulation graph 當成產品已經完成。 目前我們看到的是 simulation + technical specification + ecosystem building,不是 NVIDIA/AMD production GPU 上的大規模實機 benchmark。 2026 年 8 月公開的第一版 HBF standard 已經定義了 xPU-HBF interface、electrical、packaging、reliability 與 software I/O,而且 Google、Tenstorrent 已經參與標準制定;這代表它已經從 SanDisk 自己的 PowerPoint 往 ecosystem standard 前進了一步,但距離 hyperscaler 大規模 deployment 還有一段 execution 要證明。 所以我現在看 HBF,最重要的 observation 不是: 「哇,NAND 比 HBM 快了。」 而是: AI inference 開始出現 memory capacity 和 compute capacity 的錯配。 過去解決這個錯配的方法,是繼續塞更多昂貴的 HBM,或者乾脆再買更多 GPU。 SanDisk 現在提出第三條路: 不要為了 memory 去買 compute。 如果這條路最後真的走通,那「4 張 HBF GPU = 8 張 HBM GPU」就不只是一張漂亮的 Investor Day benchmark。 它代表的可能是一件更大的事: AI Factory 下一輪優化,不一定是讓 GPU 更快,而是讓每一顆已經買下來的 GPU,不再因為記憶體不夠而被浪費。 而如果 NAND 可以做到這件事,那市場最後要重新估的,就不只是 HBF 能賣多少。 而是: NAND 到底還是不是 storage。

Leonard

137,147 görüntüleme • 1 ay önce

Leoskie_L's profile picture

猜測一下為什麼要買huggingface 129 億買的不是模型。 是門口。 Hugging Face 年收大概 1.5 億美金。開價 129 億。八十幾倍。 這個櫃子上面掛了兩百萬個模型。開發者進來,先看櫃子,再決定今晚跑哪一顆。 跑哪一顆,下一張 GPU 訂單就從哪裡冒出來。 硬體那條龍,早就閉環了。 晶片、機櫃、網路線、CUDA、工廠。便當店爐火、蒸籠、外送箱,全部自備。客人進來就能出餐。 現在這張圖在買的是門口那塊菜單。不是再加一口鍋。 軟體若真要做成跟硬體一樣的一條龍,應該是: 訓練工廠、開源權重、分發入口、應用、再加一筆錢把電費單鎖在自己的矽上。 Poolside 那 60 億授權加 109 個人,是把廚房裡的製程單抄走。Nemotron 是自己也開始煮一鍋白飯,給人家免費裝走。 Hugging Face 是菜單跟座位表。Perplexity 那 300 億估值的股權,只是在那家最會燒午餐的店裡占一個股東位子。不是把店買下來。 這邊我會講歪。 129 億聽起來像 Nvidia 要自己做 ChatGPT。不是。 ChatGPT 那層他們不敢整段吃。吃了,最大的那幾個客人明天就開始找別的爐子。 授權、挖人、留一個殼,Groq 那套玩過了。併購審查比較吞得下「我只是買食譜」,吞不下「整條街的店都我的」。 OpenAI、xAI、SSI 那邊更複雜。 股權、租約、擔保,有一筆租約擔保被講到一千億這個數量級。CFO 自己講,資產負債表養起來的實驗室,大概會貢獻明年四分之一的生意。 這不是軟體 full stack。這是先把電費單簽在自己帳上,再等機櫃進場。 所以那張 Jensen 加 Hugging Face 的圖,看起來像聯名。 其實比較像修車廠把零件目錄收走。 你還是可以自己修車。目錄在他手上。你要哪顆零件,他先知道。 應用那一層空著。 空著不是還沒做到。是補了就從賣鏟子,變成跟礦工搶礦。 86 倍營收買一個櫃子,值不值,我現在還沒想清楚。

Leonard

37,619 görüntüleme • 1 ay önce

Leoskie_L's profile picture

這台 Wiwynn 在 Computex 2026 展的東西,表面上你看是「AI compute tray」,但其實重點根本不是 tray。重點是它在解一個很物理層的問題:AI accelerator 之間 Scale-Up 要怎麼互連,才不會被銅線、距離、功耗、散熱全部卡死。 它的做法就是 Co-Packaged Optics,CPO。簡單講,Broadcom 的 optical engine 不是放在外面交換器模組裡,而是直接跟 AI accelerator / GPU 包到同一個 substrate 上。每個 tray 裡面放兩顆 AI processor,然後光訊號直接從前面板一路進到 chip-level optical engine。這就不是「網路線插一插」那種概念了,這比較像你把高速公路出口直接開到工廠門口,貨車不用再繞市區。 前面板那邊有 detachable Fiber Array Unit,FAU,Broadcom 跟 Senko 的方案都有展示。黃色的 optical fiber 負責雙向流量,特別是 Scale-Up clustering 用的。這邊很關鍵,因為 Scale-Up 不是單純把機器連起來而已,它要的是 accelerator 之間像在同一個巨大系統裡面講話。你 latency 一高、bandwidth 一卡,整個 cluster 就開始搞笑。 然後中間那一排是 External Laser Source,ELS,也是 Broadcom 的。它透過 PM fiber,把光送到 optical engine,讓 silicon photonics 可以傳資料。也就是說,資料傳輸用的是光,但光源本身被拉出來集中管理。這有點像餐廳後場:火源不要每個爐子亂裝一套,集中供應,前面只管煮,效率跟維修都比較可控。 但 CPO 爽歸爽,問題馬上來:熱。 所以這個設計直接 100% liquid cooling,fanless。不是「GPU 水冷一下」而已,是整個 tray 裡面會發熱的東西都進水冷迴路:GPU、CPU、RAM、power module,甚至 external laser source 都吃冷板。它用 system manifold 把單一入口的冷卻液分配到各個熱源,避免某些元件先吃到已經被加熱過的水。這其實很狠,因為 AI rack 以後不是誰算力強就贏,是誰能把熱穩定帶走,誰才撐得住。 電力這邊目前 demo 是 50V input。但 Wiwynn 也在看 HVDC,例如 800V 或 +/-400V。這方向不意外,因為 rack power density 一直往上衝,低壓大電流會讓線材、銅損、配電全部變成災難。你不能一邊說我要 mega Scale-Up cluster,一邊還用傳統配電方式硬撐,最後不是效率血虧,就是機櫃裡面變烤箱。 整體拓撲也很清楚:這些 compute trays 塞進 dedicated compute rack,然後透過前面板 optical patch panel 接到多個 switch racks,組成大型 Scale-Up AI cluster。 所以這台東西真正想講的是: AI 伺服器已經不是「GPU 多放幾顆」的時代了。現在卡的是 L5 連接、L3 散熱、L6 封裝、L2 電力,全部一起卡。CPO 把光拉到 chip 旁邊,liquid cooling 把熱抽走,HVDC 則是下一步要解電力配送。 credit to :

Leonard

38,225 görüntüleme • 3 ay önce

Daha fazla içerik yok.