
Leonard
@Leoskie_L • 11,144 subscribers
AI Semi & Supply Chain | Warsaw × Taiwan Physical layer | US demand ↔ TW supply 100% incremental GM from depreciation expiry Not advice • Just physics.
Videos

SanDisk CTO Alper Ilkbahar 在 Investor Day 放出了一個我認為比「HBF 有多快」更值得看的數字: 4 張 HBF GPU,可以做到 8 張 HBM GPU 的 token output。 表面上看,很容易把它理解成「HBF 讓 GPU 性能提升 2 倍」。 但我覺得這樣理解反而低估了這個 demo。 因為 HBF 真正解掉的東西,不是算力,而是現在 AI inference 裡一個越來越昂貴的問題: 很多時候,我們買更多 GPU,不是因為缺 FLOPS,而是因為模型塞不進去。 SanDisk 的模擬很直接。 他們先拿一顆類似目前市場主流高階 GPU 的架構,每張 GPU 配 192GB HBM。然後做第二個版本,把 HBM 全部換成 HBF,讓單張 GPU 的 near-compute memory 從 192GB 拉到大約 4TB。 這個 4TB 其實也和現在公開的 HBF 架構方向對得上。SanDisk 與 SK hynix 最新公布的第一版開放 HBF 規格,單個 HBF stack 最高 512GB;如果一顆 accelerator 配八組,就是大約 4TB。HBF 的目標 bandwidth 則分成約 0.4TB/s 到 3TB/s 三個等級。 接著他們跑一個模擬的 agentic coding workload:AI agent 不斷寫 code、產生新任務、讀取上下文,再繼續工作,底層是一個接近 490B 級別的 Qwen3 模型。 這類 workload 很有意思,因為它不是一次問答就結束。 Agent 活得越久,context 越長,KV cache 越大,同時還要把巨大的 model weights 放在離 GPU 足夠近的位置。Qwen 官方公開的 Qwen3-Coder-480B 本身就是 480B total parameters、35B active parameters,而且原生 context 已經做到 256K。 所以當 SanDisk 把它丟進只有 192GB HBM 的 GPU 時,第一個問題根本還不是 GPU 算得快不快。 第一個問題是:放不下。 按照他們的模擬,HBM 系統至少需要 8 張 GPU 才能開始跑這個 workload。 注意這裡的「8」。 這八張 GPU 並不是因為模型需要八張 GPU 的 compute 才算得動,而是 memory capacity 逼你先買八張 GPU。 你本來可能只需要其中一部分算力,但為了取得綁在 GPU 上面的 HBM capacity,只能把 GPU 一起買回家。 這就是我會稱它為 GPU memory tax 的地方。 GPU 現在其實同時賣給你兩樣東西:compute 和 memory capacity。但 AI inference 對這兩樣東西的需求成長速度並不一定一致。 你可能缺 1TB memory,卻沒有缺對應那麼多 FP8 FLOPS。 可是 HBM 又焊在 accelerator package 上。 於是缺 memory 的解法變成:買更多 GPU。 這才是 SanDisk 這個 demo 真正想拆掉的東西。 把同樣架構換成大約 4TB HBF 之後,一張 GPU 就已經可以把整個 workload 裝進去。 一張 HBF GPU 當然沒有八張 HBM GPU 快,SanDisk 自己也沒有假裝它會比較快。 但事情到這裡已經完全變了。 因為以前你的「minimum viable system」是八張 GPU;現在 minimum viable system 變成了一張。 然後 SanDisk 再把 HBF GPU 加到四張。 結果: 4 HBF GPU ≈ 8 HBM GPU 的 token output。 這裡才出現所謂的「2× performance per GPU」。 但我要特別強調: 這不是 HBF 的 NAND cell 比 HBM DRAM 快兩倍。 也不是同一顆 GPU 換上 HBF 之後 matrix multiplication 突然快兩倍。 真正發生的是,memory capacity 改變了 workload 怎麼被切割。 原本八張 HBM GPU 必須共同承擔一個巨大的 memory footprint,模型被迫跨 GPU 分散,GPU 之間還需要搬資料、同步、做 tensor/model parallel。 HBF 把單 GPU memory pool 拉到 TB 級之後,很多原本為了「塞下模型」而存在的 GPU partitioning 可以被拿掉。 GPU 終於比較像是在買 compute,而不是買昂貴的 HBM 擴充卡。 所以我反而會把 SanDisk 的數字寫成: HBF 沒有讓一張 GPU 算得快兩倍;它讓同樣的 inference throughput,只需要一半的 GPU。 這兩句話看起來很像,經濟意義卻完全不同。 前者是一個 memory benchmark。 後者是在談 AI Factory 的資本效率。 如果四張 accelerator 可以完成過去八張 accelerator 的工作,那被影響的就不只是 memory BOM。 GPU 數量、server 數量、NVLink / scale-up fabric、NIC、switch、power delivery、液冷、機櫃空間,甚至整個 data center 的 MW / token 都可能一起往下走。 這也是為什麼 SanDisk 現在一直講 token economics,而不只是 NAND ASP。官方在最新 HBF 規格公告裡,也把目標直接寫成改善 inference 的 power、performance 與 total cost of ownership。 而對我來說,這才是 HBF 對 SNDK 最大的想像空間。 以前 NAND 在 AI infrastructure 裡的位置很清楚: GPU → HBM → DRAM → SSD → storage。 離 compute 越遠,價值密度越低。 SanDisk 現在想做的,其實是在這個 hierarchy 裡硬插一層: GPU → HBM / HBF → DRAM / SSD。 SK hynix 自己也直接把 HBF 定義成位於 HBM 與 SSD 之間的新 memory layer,而 SanDisk 的 OCP 規格更明確談到 HBF 與 HBM 可以 coexist。 這點很重要。 我不認為最合理的 bull case 是: HBF 把 HBM 幹掉。 HBM 的 latency、write characteristics,以及真正需要極低延遲反覆讀寫的 hot data,依然有很強的物理優勢。 更合理的架構反而可能是: 最熱的 activation、KV cache 留在 HBM; 大量 model weights、較冷的 KV、agent state,以及那些「需要非常大容量、但不需要每一個 byte 都享受 HBM latency」的東西,逐漸搬到 HBF。 這樣反而更麻煩。 因為如果 HBF 真的成立,SanDisk 搶的並不只是 SSD 裡面多幾顆 NAND。 它是在嘗試讓 NAND 向 compute 靠近一層。 從 storage media,變成 accelerator architecture 裡的一部分。 這會直接改變 NAND 的價值量。 不過現在也不能把這張 simulation graph 當成產品已經完成。 目前我們看到的是 simulation + technical specification + ecosystem building,不是 NVIDIA/AMD production GPU 上的大規模實機 benchmark。 2026 年 8 月公開的第一版 HBF standard 已經定義了 xPU-HBF interface、electrical、packaging、reliability 與 software I/O,而且 Google、Tenstorrent 已經參與標準制定;這代表它已經從 SanDisk 自己的 PowerPoint 往 ecosystem standard 前進了一步,但距離 hyperscaler 大規模 deployment 還有一段 execution 要證明。 所以我現在看 HBF,最重要的 observation 不是: 「哇,NAND 比 HBM 快了。」 而是: AI inference 開始出現 memory capacity 和 compute capacity 的錯配。 過去解決這個錯配的方法,是繼續塞更多昂貴的 HBM,或者乾脆再買更多 GPU。 SanDisk 現在提出第三條路: 不要為了 memory 去買 compute。 如果這條路最後真的走通,那「4 張 HBF GPU = 8 張 HBM GPU」就不只是一張漂亮的 Investor Day benchmark。 它代表的可能是一件更大的事: AI Factory 下一輪優化,不一定是讓 GPU 更快,而是讓每一顆已經買下來的 GPU,不再因為記憶體不夠而被浪費。 而如果 NAND 可以做到這件事,那市場最後要重新估的,就不只是 HBF 能賣多少。 而是: NAND 到底還是不是 storage。
Leonard137,147 görüntüleme • 1 ay önce

記憶體現在漲到這種程度, 其實是在逼整個產業把 HBM 工程掉。 Cathie 講得很直接:Cerebras、Groq 這種推理晶片,根本不需要高頻寬記憶體。 Tesla 當年鈷價亂飛、供應鏈一堆問題,Elon 直接把鈷從電池裡拿掉大部分。 現在推理端也在做一樣的事。 價格漲三倍、四倍、十倍, 不是科技業的正常狀態,是負面訊號。 因為當瓶頸變得太痛,大家就會開始繞路。 記憶體廠像把海峽鎖死一樣,短期有效, 但長期只會讓人蓋管道、蓋新港口。 等下次再想鎖,已經沒人會再走那條路了。 你覺得現在這波記憶體漲價, 是在創造下一個被工程掉的瓶頸,還是真的變成長期結構?
Leonard100,991 görüntüleme • 1 ay önce

去年九月,群聯電子潘董在台灣受訪,講 NAND 會缺十年。 現場在笑。十一月產業還是不信。 他現在站在 Semicon Taiwan 講同一句。 貨已經不夠。他說明年會更慘。 不是客人少。是廚房火不夠大。 便當一直點,爐子還是那兩口。HBM 把錢跟產能吸走之後,NAND 新廠不是下季就能倒貨出來的東西。有人講過,蓋得到顆粒要四年。四年。 後面那截比較少人停。 推理的輸入是電。輸出是 token。token 要有地方放。 潘董自己講:雲端 AI 的營收跟儲存容量成線性。要無限營收,就要蓋沒上限的儲存。 我本來想這只是漲價故事。 不是。 是倉庫層。單子開得出來,貨架補不回來。控制器公司先撞到牆,因為他不是產顆粒的人,他是等人家把顆粒交出來才能出貨的人。 明年誰會排不到,我還沒想清楚。 先確定一件事:笑完的人,現在不是在辯循環,是在排隊。
Leonard39,458 görüntüleme • 24 gün önce

美光台灣今天丟出 FY26 獎酬包。現金從 170 萬起。初階工程師平均現金 290 萬,加上股票授予價值,平均 340 萬。產線整體薪酬,公司寫 35 到 68 個月。 感謝現金 100 萬,限 2025/8/29 前到職。之後按比例。績效獎金最高目標 500%。股票覆蓋 100%。全球 6 萬人。在台約 1.5 萬人,累計投資 1.6 兆。 這包是總薪酬。不是入袋現金 68 個月。股票用授予價值算進去。 工會同一天拆過一筆:月薪 6 萬,100 萬加績效約 45 萬,股票約 6 萬,名目約 153 萬,折約 25 個月。分母兩邊都沒對完。 工會桌上還在要的是另一張。FY26 再發一次,他們先前折成約 83 個月。明年起營業利益切 15%,按季發。不是今天這包。 第一次調解 9/4 沒共識。第二次 9/21。財報 9/30。調薪窗口 10/1。線還在轉。公式還沒對上。 中央社:
Leonard25,605 görüntüleme • 17 gün önce

離神算子上次說的股市已經修復一段了! 他基準不是降息。是 9 月 15 日按住,標普先摸 8000。 Tom Lee(湯姆·李)基準不是降息。是按住。不升、也不降。外面已經把 9 月淡季、有人喊升息、AI 機房反噬疊在同一個月。人怕到這個程度,他反而覺得市場可能往上嚇你一跳。 週五就業、9 月稍早還有 CPI。兩邊偏弱,市場就不再把升息寫進程式。利率這個錢的價錢先不動,場邊等著的現金才有理由出來。便當店這週不漲價,不是變便宜,是原本以為要加價、先不點的那些人會回來。 回調他沒刪。只是往後推到 10 月。可能先過 8000,再掉到 7300、7400 那種位置。年底他還是覺得 8200 可能偏低。 我本來聽到「不加息就大漲」會覺得太順。他自己講的是按住。降息多半是景氣先爛;按住只是升息這隻鬼先死。就業那張表片裡講的週五,現在已經過了。剩下 CPI 跟 9/15 當天那一票。 兩張表如果沒一起弱,這條路就還是假設。
Leonard27,051 görüntüleme • 19 gün önce

十台 Cybercab,換算台幣大概 950 萬。 台北市近一年均價約 79 萬一坪,950 萬能買約 12 坪。萬華大同文山的老套房這個價偶爾有;大安信義不用想。桃園區近一年大約 48 萬一坪,950 萬大概 20 坪,小兩房,或兩間套房。竹北落在 48 到 61 萬,也是 16 到 20 坪那個帶。 桃園春日路有一筆 2026 年 7 月實價,10 坪套房 325 萬。十台車的錢,那邊可以買將近三間。 租金更難看。北市獨立套房中位數一個月 1.5 萬,桃園 9 千,新竹 1 萬。 片子裡路人說五台就夠一年一百萬美元。Kim 自己算過,Tesla 抽 30% 再扣 FSD 年費,一台剩大概兩萬美金,台幣一年 63 萬,一個月 5.3 萬。十台一個月 53 萬。等於同時收 35 間台北套房,或 59 間桃園套房。 表面報酬很誇張。950 萬本金、十台一年 630 萬,年報酬可以寫到六成。空車、清洗、保險、誰能買、能不能自己養車隊,這些都還沒進公式。Tesla 正式數字也還沒出來。 文藝復興不是這個詞。就是同一筆 950 萬,一邊買 12 坪台北老套房,一邊買十台可能自己會跑的鐵盒子。羨慕的是窗口還開著。 數字來源:匯率央行 9/4;北北桃竹單價 5168/HouseFeel 近一年;租金中位數內政部租補統計 2026 上半年;春日路那筆好房 2026/7 實價。
Leonard28,521 görüntüleme • 22 gün önce

猜測一下為什麼要買huggingface 129 億買的不是模型。 是門口。 Hugging Face 年收大概 1.5 億美金。開價 129 億。八十幾倍。 這個櫃子上面掛了兩百萬個模型。開發者進來,先看櫃子,再決定今晚跑哪一顆。 跑哪一顆,下一張 GPU 訂單就從哪裡冒出來。 硬體那條龍,早就閉環了。 晶片、機櫃、網路線、CUDA、工廠。便當店爐火、蒸籠、外送箱,全部自備。客人進來就能出餐。 現在這張圖在買的是門口那塊菜單。不是再加一口鍋。 軟體若真要做成跟硬體一樣的一條龍,應該是: 訓練工廠、開源權重、分發入口、應用、再加一筆錢把電費單鎖在自己的矽上。 Poolside 那 60 億授權加 109 個人,是把廚房裡的製程單抄走。Nemotron 是自己也開始煮一鍋白飯,給人家免費裝走。 Hugging Face 是菜單跟座位表。Perplexity 那 300 億估值的股權,只是在那家最會燒午餐的店裡占一個股東位子。不是把店買下來。 這邊我會講歪。 129 億聽起來像 Nvidia 要自己做 ChatGPT。不是。 ChatGPT 那層他們不敢整段吃。吃了,最大的那幾個客人明天就開始找別的爐子。 授權、挖人、留一個殼,Groq 那套玩過了。併購審查比較吞得下「我只是買食譜」,吞不下「整條街的店都我的」。 OpenAI、xAI、SSI 那邊更複雜。 股權、租約、擔保,有一筆租約擔保被講到一千億這個數量級。CFO 自己講,資產負債表養起來的實驗室,大概會貢獻明年四分之一的生意。 這不是軟體 full stack。這是先把電費單簽在自己帳上,再等機櫃進場。 所以那張 Jensen 加 Hugging Face 的圖,看起來像聯名。 其實比較像修車廠把零件目錄收走。 你還是可以自己修車。目錄在他手上。你要哪顆零件,他先知道。 應用那一層空著。 空著不是還沒做到。是補了就從賣鏟子,變成跟礦工搶礦。 86 倍營收買一個櫃子,值不值,我現在還沒想清楚。
Leonard37,619 görüntüleme • 1 ay önce

SpaceX 會是第一家破 100 兆美元的公司。 不是因為它會發射多少火箭。 是因為它正在把數據中心從地球上搬走。 地球上的 AI 現在卡在兩件事:電跟水。 電網不夠、冷卻水不夠、土地不夠。 就像你想在台北市中心開一家 24 小時大火爐便當店,鄰居直接報警。 SpaceX 的 AI1 不是什麼科幻。 他們已經把草案攤在桌上:150 千瓦峰值、120 千瓦持續運算。 太陽能板用現成的 Starlink V3 技術,散熱器雙面、刀刃朝向太陽,直接把熱輻射進真空。 有人說真空是超爛的熱導體。 對,傳導很差。 但輻射本來就是真空唯一的散熱方式,而且太陽永遠在,不用付電費、不用搶水、不用跟地方政府搶地。 他們不是在發明新東西。 是把已經發射過、已經在天上飛的零件,放大、重新排列。 就像修車廠把本來裝在貨車上的發電機,拆下來裝到一艘不會停的船上。 那些現在還在笑「這不可能」的人, 大概還在用 2023 年的物理直覺看 2026 年的工程圖。 等一下。 真正的問題不是「能不能做」。 是誰先把電力跟散熱這兩個物理瓶頸,從地表解掉。 你覺得呢?
Leonard46,255 görüntüleme • 1 ay önce

Ray Dalio 債務問題後面,一定跟著貨幣貶值。 這不是什麼新理論,是物理層重複發生的事。 1933 年羅斯福面對債務,被迫脫離金本位,大量印鈔,讓美元直接貶值。 1971 年尼克森又來一次,幾乎是同一套動作。 兩次結果都很像:錢被創造出來之後,不會原地蒸發,它會去找其他地方。 股票、黃金、或其他相對更硬的東西。 債券本質上就是「很長一段時間的貨幣部位」。 當實質利率掉到接近零、甚至轉負,這個部位就開始變得不吸引人。 大家會發現:與其持有它,不如直接去借它。 然後資金開始移動。 明年、後年,不管怎麼算,赤字還是會很大。 債務還是會被貨幣化。 紙變多了,購買力就往下掉。 所以現在看黃金,不是什麼情緒操作,是大家在找「不會被無限印出來的東西」。 這個邏輯其實很舊,只是這次的債務規模比以前大很多。
Leonard39,967 görüntüleme • 1 ay önce

神算子Tom Lee 這段講的其實很單純。 他把幾件事疊在一起:美國經濟成長率好像開始往上走,成熟大國還能摸到 4%,這本身就有點怪。同時美國是 AI 產品的淨出口國,高價值東西往外流,現金最後會回來。再加上一堆錢卡在私募另類裡,遲早要往公開市場挪。後面再補上人口結構——千禧跟 Z 世代開始工作,也開始繼承。 他直接講 after 2026、未來兩年,可能是我們這輩子看過最大的股市漲幅之一。 我覺得真正有意思的是他把「成長加速 + 高價值出口 + 資金重配置 + 人口紅利」這幾條線硬扯在一起。不是單一故事,是好幾台馬達同時轉。 這不代表明天就會怎樣。物理層最後還是會說話。
Leonard45,027 görüntüleme • 1 ay önce

以前是: 「你要 GPU?找 NVIDIA。」 現在變成: 你要 GPU? 老黃:我有。 你要 Networking? 我有。 CPU? 我有。 整座 AI Factory? 我幫你弄。 生日派對? 可以。 遊艇? ……你先說幾呎。 看到這裡你才會發現,這已經不是什麼 semiconductor ecosystem 了。 這根本是一部黑幫電影。 客戶走進去,本來只是想買幾張 GPU。 最後 Jensen 把手搭在你肩膀上: 「不用擔心,你現在是 Family 了。」 PayPal 有 PayPal Mafia。 AI 時代,我看要叫 Huangfia。🤌
Leonard43,049 görüntüleme • 1 ay önce

Dylan 大言不慚。 他站在物理層上講話,語氣像在宣判:SRAM 就是天花板,Cerebras 這種東西撐不住超大模型加長 context。聽起來很硬,很有物理感,也很有權威感。 然後 CEO 出場。 $CBRS Andrew Feldman 沒有生氣,沒有反嗆,也沒有表演性的情緒。他只是很平地把結果講出來:我們跑了,數字貼出來了,比次快的 GPU 雲還快 6-7 倍。一邊貼成績單,一邊有分析師還在電視上說「他們做不到」。 他甚至還補了一句:我最喜歡收集別人的大言不慚錯例子的人。 語氣很平。 但這平,反而更重。 一邊是在物理層上大聲放話、先把對手框死; 一邊是心平氣和地把已經發生的事實丟出來。 真正打臉的,從來不是誰聲音比較大,而是誰先把東西跑完。
Leonard35,996 görüntüleme • 1 ay önce

這台 Wiwynn 在 Computex 2026 展的東西,表面上你看是「AI compute tray」,但其實重點根本不是 tray。重點是它在解一個很物理層的問題:AI accelerator 之間 Scale-Up 要怎麼互連,才不會被銅線、距離、功耗、散熱全部卡死。 它的做法就是 Co-Packaged Optics,CPO。簡單講,Broadcom 的 optical engine 不是放在外面交換器模組裡,而是直接跟 AI accelerator / GPU 包到同一個 substrate 上。每個 tray 裡面放兩顆 AI processor,然後光訊號直接從前面板一路進到 chip-level optical engine。這就不是「網路線插一插」那種概念了,這比較像你把高速公路出口直接開到工廠門口,貨車不用再繞市區。 前面板那邊有 detachable Fiber Array Unit,FAU,Broadcom 跟 Senko 的方案都有展示。黃色的 optical fiber 負責雙向流量,特別是 Scale-Up clustering 用的。這邊很關鍵,因為 Scale-Up 不是單純把機器連起來而已,它要的是 accelerator 之間像在同一個巨大系統裡面講話。你 latency 一高、bandwidth 一卡,整個 cluster 就開始搞笑。 然後中間那一排是 External Laser Source,ELS,也是 Broadcom 的。它透過 PM fiber,把光送到 optical engine,讓 silicon photonics 可以傳資料。也就是說,資料傳輸用的是光,但光源本身被拉出來集中管理。這有點像餐廳後場:火源不要每個爐子亂裝一套,集中供應,前面只管煮,效率跟維修都比較可控。 但 CPO 爽歸爽,問題馬上來:熱。 所以這個設計直接 100% liquid cooling,fanless。不是「GPU 水冷一下」而已,是整個 tray 裡面會發熱的東西都進水冷迴路:GPU、CPU、RAM、power module,甚至 external laser source 都吃冷板。它用 system manifold 把單一入口的冷卻液分配到各個熱源,避免某些元件先吃到已經被加熱過的水。這其實很狠,因為 AI rack 以後不是誰算力強就贏,是誰能把熱穩定帶走,誰才撐得住。 電力這邊目前 demo 是 50V input。但 Wiwynn 也在看 HVDC,例如 800V 或 +/-400V。這方向不意外,因為 rack power density 一直往上衝,低壓大電流會讓線材、銅損、配電全部變成災難。你不能一邊說我要 mega Scale-Up cluster,一邊還用傳統配電方式硬撐,最後不是效率血虧,就是機櫃裡面變烤箱。 整體拓撲也很清楚:這些 compute trays 塞進 dedicated compute rack,然後透過前面板 optical patch panel 接到多個 switch racks,組成大型 Scale-Up AI cluster。 所以這台東西真正想講的是: AI 伺服器已經不是「GPU 多放幾顆」的時代了。現在卡的是 L5 連接、L3 散熱、L6 封裝、L2 電力,全部一起卡。CPO 把光拉到 chip 旁邊,liquid cooling 把熱抽走,HVDC 則是下一步要解電力配送。 credit to :
Leonard38,225 görüntüleme • 3 ay önce

56年,只見過一間。 客戶賺了150億。 他自己主動放棄30億利潤,就是不賣。 寧可少賺,也不要被Elon看成「一有機會就跑」的那種人。 最近底部照樣繼續抱著,沒動。 不是火箭公司。 是把通訊跟算力,從地面電力、電纜、冷卻水管那些物理限制裡,硬生生拔到軌道上的東西。 原本只是想重複使用火箭。結果多餘產能變成全球互聯網,再變成把算力直接租給Anthropic一個月12.5億、Google九億。幾乎30億美金一年的現金流,從原本低報酬的資產裡生出來。 等一下,AI當然是世代躍進。 但AI還是卡在地球表面的電跟散熱。 這家把那個瓶頸往上推了一層。 現在人類真的要開始探索其他地方了。 你覺得呢?
Leonard15,995 görüntüleme • 1 ay önce
Daha fazla içerik yok.