Sensitive content

This media may contain sensitive content.

Загрузка видео...

Не удалось загрузить видео

На главную

MMX 163A + irontech A3 娃娃與AI語音互動系統 模擬演練展示 #ラブドール #實體娃娃

46,316 просмотров • 21 дней назад •via X (Twitter)

Комментарии: 0

Нет доступных комментариев

Здесь появятся комментарии из оригинального поста

Похожие видео

這是我第一次聽到 Jim Fan 的演講,非常幽默有趣,然後我覺得有生之年大概買一台人形機器在家處理家事、幫你洗頭髮大概穩了,好好活著,各位。 在 AI 領域,我們常聽說圖靈測試(Turing Test)是衡量機器能否展現與人類無異對話能力的里程碑。如今,大型語言模型(LLM)似乎已悄悄地通過了這個測試,但大家對其突破已習以為常,甚至會因為語音助理慢了幾秒或程式碼沒被完全除錯而抱怨連連。 NVIDIA AI 研究總監、身為廣受矚目人形機器人專家 Jim Fan 指出,當前業界對 LLM 的驚人進步視為「只是又一個平常的星期二」(just yet another Tuesday),這反映了我們對文字世界 AI 的標準已大幅提高。 然而,當我們將目光轉向現實世界,讓機器人進行物理操作時,會發現挑戰巨大得多。 Jim Fan 在演講中提出了一個引人深思的概念:「物理圖靈測試 (Physical Turing Test)」。這個測試的想像情境是:如果你回家後,看到雜亂的房間被整理得乾淨俐落,甚至還準備了一頓浪漫的燭光晚餐,而你無法分辨這是由真人還是機器人完成的,那代表這個機器人通過了物理圖靈測試。 但現實呢?看看那些連站起來都困難的人形機器人,或是嘗試為主人做早餐卻搞得一團亂的機器手臂(雖然辨識出牛奶值得給 A-,但湯匙餵食的確是 VIP 等級的體驗),我們離「物理圖靈測試」還差得很遠。 實體 AI 的最大瓶頸:資料飢渴症 為什麼物理圖靈測試如此困難? Jim Fan 點出了核心問題:資料。LLM 研究人員抱怨網際網路資料快被用完,稱其為 AI 的「化石燃料」。但對機器人學家來說,我們甚至連這種「化石燃料」都沒有。真實世界的機器人資料——例如關節的精確控制訊號、連續的運動軌跡——是無法從網路上抓取的。這些資料必須透過昂貴且耗時的「遙控操作」(teleoperation)方式收集,也就是由真人穿戴感應裝置來遠端控制機器人,手把手地教它完成任務(例如從烤麵包機拿出麵包再淋上蜂蜜)。 這種方式極度沒效率,Jim Fan 將其比喻為燃燒「人類燃料」(human fuel),比化石燃料還稀缺,每天每個機器人頂多運作 24 小時,而且真人會累,機器人更容易壞。這嚴重限制了機器人學習的多樣性和規模,形成了一個巨大的資料瓶頸。 模擬世界的核能:突破資料荒的救星 要突破這個瓶頸,唯一的出路是「模擬 (Simulation)」,找到機器人學的「核能」。Jim Fan 介紹了NVIDIA為此推進的三階段模擬策略: 模擬 1.0:數位分身 (Digital Twin) 概念:在虛擬世界中建立機器人和環境的一對一精確拷貝。 方法:利用高效能的向量化物理引擎,可以在單一 GPU 上模擬上萬個環境,速度比現實世界快上萬倍。結合「領域隨機化 (Domain Randomization)」技術,在模擬時隨機改變重力、摩擦力、物體重量等參數,迫使 AI 在各種條件下都能執行任務。 優勢:極快的訓練速度。訓練出的模型可以直接零次轉移 (zero-shot) 到真實世界機器人上,無需微調。例如,訓練機械手在模擬中轉筆,訓練機器狗在球上平衡,訓練人形機器人行走(10 年訓練量在 2 小時模擬完成)。一個僅有 150 萬參數的神經網路就足以捕捉人形機器人全身平衡和敏捷動作的複雜控制。 限制:數位分身需要人工精確建模,建立複雜環境耗時費力,模擬的多樣性仍然受限於人工設定的範圍。 模擬 2.0:數位表親 (Digital Cousin) 概念:開始在模擬中引入生成式 AI。雖然不像數位分身那樣是精確拷貝,但能產生足夠多樣的環境和場景,「像數位分身的表親」。 方法:利用 3D 生成模型生成場景中的各種物品(如家具),使用擴散模型(Diffusion Model)生成紋理貼圖,利用 LLM 根據文字提示生成場景佈局的 XML 檔案。 NVIDIA 的 Robocasa 框架就是例子,可以生成大規模、包含日常任務的模擬場景,除了機器人本身,其他幾乎都是生成的。 優勢:顯著增加了環境和任務的多樣性。可以在模擬中進行遙控操作,然後將軌跡變異、擴展到更多生成的環境中,實現 N (環境數) * N (動作變異數) 的資料乘法爆炸。雖然畫面真實度可能不及真實世界,但「足夠接近」。 限制:相較於 1.0,運行速度可能較慢,仍部分依賴傳統渲染管線。 模擬 3.0 (世界模型 / 擴散模型):數位遊牧者 (Digital Nomad) 概念:直接利用生成式模型(特別是影片擴散模型)來模擬物理世界的互動,擺脫對傳統物理引擎的依賴。 方法:以大量真實世界影片(數百萬段網路影片)訓練影片擴散模型,使其學會模擬各種複雜的物理現象(如流體、軟體變形)。 NVIDIA 的研究表明,只需用真實機器人實驗室收集的少量領域特定資料微調通用的影片生成模型,就能讓模型學會模擬機器人的精確互動。 優勢:極致的多樣性。影片擴散模型能模擬任何它在訓練資料中「看過」或「想像」的互動,不受傳統物理引擎的限制(例如模擬機器人彈烏克麗麗,即便硬體不支援,模型也能「畫」出來)。 這就像讓機器人漫遊在影片模型的「夢境空間」(dream space)——一個壓縮了海量網路影片的多元宇宙,實現「萬物、處處、一時」(Everything Everywhere All at Once) 的互動學習。僅僅一年時間,影片生成模型在物理真實度上(例如變形麵條)的進步,就超越了傳統圖學 30 年的發展。 速度:目前運行可能較慢,但具備隨算力呈指數級成長的巨大潛力。 具身縮放定律與 GR00T N1 Jim Fan 總結,傳統模擬(1.0)的速度快但受限於多樣性,而生成式模擬(2.0/3.0)雖可能起步慢但能隨算力呈指數級擴展其多樣性。這兩種模擬方式的結合,將是為下一代機器人系統提供龐大訓練資料的「核能」。這也意味著,對 AI 算力的需求只會越來越大,那些認為算力問題會迎刃而解的人需要再三思考。 藉由這些模擬技術產生的海量資料,NVIDIA 開發了「視覺語言行動模型 (Vision Language Action Model, VLA)」,能接收圖像和語言指令,並直接輸出機器人的運動控制訊號。今年 GTC 大會上黃仁勳發表的 GR00T N1 模型就是一個實例,它能在真實世界執行抓取香檳、工廠零件甚至多機器人協調等任務。 GR00T N1 已開源,NVIDIA 也計劃將未來的模型開源,以普及「實體 AI」。 物理 API:通往新世界的入口 實體 AI 的最終目標,是實現「物理 API (Physical API)」。想像一下,就像 LLM API 讓軟體能夠操作數位世界的位元 (bits) 一樣,物理 API 將賦予軟體操作現實世界的原子 (atoms) 的能力。透過這個 API,你可以讓軟體直接控制物理致動器,改變物理世界的狀態。 這將催生全新的經濟模式和應用場景: 物理提示 (Physical Prompting):不再只用文字,而是結合視覺和語言等方式更直觀地教導和指示機器人。 物理應用商店和技能經濟 (Physical App Store & Skill Economy):米其林大廚不必親自下廚,他可以「教導」機器人他的獨家烹飪技巧,並將這個技能作為服務販售,讓任何擁有機器人的家庭都能享受到米其林級的晚餐。 Jim Fan 引用黃仁勳的話再次強調,未來「每一個會移動的東西都將是自主的」。總有一天,你回家會看到乾淨的沙發和燭光晚餐,伴侶對你微笑而不是責備你沒做家事——而那一天,我們通過物理圖靈測試的時刻,很可能就像 LLM 通過圖靈測試一樣,在世人眼中「只是又一個星期二」。這正是驅動 Jim Fan 和團隊每天努力的動力。

fox hsiao

19,553 просмотров • 1 год назад

[双女主] 现代女同剧:裴总今天开窍了吗?EP11-21全集+番外 | 十年暗恋,终于等到一句‘我爱你’,七年前的娃娃亲为什么成真?#百合 #GL #双女主 #AI短剧 #AIVIDEO 郁清若的父亲告诉他,郁正榜来续娃娃亲,原定他与郁家老大,但两人不合适,改换老二(实际是裴路年),并告知对方叫郁清若(视频中口误,实为裴路年),性格优秀。郁清若同意见面,随后回家向自己父亲提出想去公司上班,因为喜欢裴氏集团的裴路年,想配得上对方。父亲透露裴家与自家也定过娃娃亲,原是郁清若哥哥和裴路年,因不合适作罢,允诺郁清若站稳脚跟后可去提亲。在一次宴会中,郁清若迷路,裴路年为他指路并扶住他。两人相亲时,裴路年直接提出结婚条件:婚后住他那边、财产公证、必要场合一起出席,并要求信息素检测报告(93.6%),约定次日领证。领证后,裴路年在合作客户陈总面前介绍郁清若是他太太,似有宣示主权,随后私下查陈氏集团,吃醋不承认。郁清若信息素不稳,裴路年陪他并稳定反应,两人关系渐密。郁清若生日时裴路年出差忘记,闺蜜姜念提醒后裴路年补送礼物。郁清若收回主动,裴路年不习惯,开始做饭、送花、换香氛(郁清若信息素味道),变得主动。郁清若怀孕后,裴路年更加体贴,告知双方家庭并陪产,女儿芝芝出生。裴路年表示对女儿好是因为女儿是郁清若生的,郁清若最重要。芝芝一岁半时,裴路年哥哥玉衡回国,提及当年周岁宴上裴路年指着郁清若喊“老婆”,而原本娃娃亲对象是郁清若哥哥,裴路年不要,选了郁清若。

AI短剧

47,473 просмотров • 1 месяц назад

時隔三年揭密特斯拉 AI 核武器:不只「端到端」,解密征服物理世界的「神經網路模擬器」 距離上一次特斯拉舉行 AI Day 分享科技樹經過三年,一般猜測因為由於分享得太過仔細,導致於中國同行在相關技術上,突然打藥般地往前跨越一些,也或許是看了懂車帝的評測之後,馬誼郎覺得對手差太遠,只好再讓大家看一下特斯拉具體的做法。 建議直接看影片會更為直觀台灣無法使用的輔助自動駕駛在國外已經是怎麼在上路了,請記得協助按讚分享。 本次由特斯拉 AI 負責人 Ashok Elluswamy 登台,在頂尖的電腦視覺會議 International Conference of Computer Vision (ICCV) 上分享,這場演講的核心,不只是宣揚其數據護城河,而是揭示一個殘酷的事實:傳統「模組化」的自駕路徑正迎向根本性的天花板。 Elluswamy 拋出一個 「微型電車難題」:車輛應駛過一個大水坑,還是冒險駛入對向車道?傳統程式碼會因「禁止駛入對向車道」的僵化規則而卡死。接著,他展示第二個場景:AI 如何區分「一群要過馬路的雞」(需要耐心等待)與「一群只是想待著的鵝」(可以倒車繞行)。 「要將人類價值觀轉換成程式碼真的非常困難。」 Elluswamy 指出,這些充滿細微權衡與意圖判讀的情境,根本無法用客觀的程式碼精確定義。舊範式試圖用僵化的規則去模仿人類的直覺,註定失敗。特斯拉的答案是徹底拋棄這種分工,轉而採用單一大型神經網路,實現從「像素輸入」到「駕駛動作輸出」的 端到端(End-to-End) 決策。 這個系統不再依賴工程師的規則,而是直接從海量的人類駕駛數據中,學習那些無法言傳的「價值偏好」。這是一場關於 典範轉移 的豪賭,賭注是未來所有機器人的作業系統。 駕馭維度災難:從「數據瀑布」到「二階效應」的預判 轉向端到端範式,意味著一場更艱鉅的挑戰:維度災難(Curse of Dimensionality)。Ashok Elluswamy 揭示的數字是殘酷的:特斯拉的系統必須在即時狀態下,將八個攝影機、30秒上下文、音訊、地圖與運動數據——總計高達 二十億個輸入標記——壓縮到僅僅兩個輸出標記:轉向與加速。在如此極端的資訊壓縮過程中,模型極易產生「虛假的相關性」,錯把噪音當成訊號。 這正是特斯拉車隊規模發揮槓桿作用的時刻。面對這「尼加拉瀑布般的數據」(Elluswamy 證實車隊每天能產生500年駕駛時長),特斯拉的解方不是盲目儲存,而是 精煉。系統利用特定的觸發條件或小型神經網路,主動「挖掘」那些最稀有、最關鍵的 邊緣案例(corner cases)。 這些罕見情境(例如前方車輛的詭異動態、路面上的非典型障礙物)是訓練AI的最高價值養分,也是傳統模組化系統最容易崩潰的地方。 用高品質的邊緣數據餵養端到端模型,其回報是驚人的 預判能力。 在一個展示影片中,前方車輛在高速公路上失控打滑。特斯拉的系統在極短時間內做出重煞決策。但關鍵不在煞車本身,而在於 時機。系統並非在偵測到「碰撞風險」時才反應,而是在偵測到前車「即將失控」的瞬間就已啟動煞車。 「它沒有等到車輛撞上護欄再彈回來...特斯拉就已經判斷出這輛車狀況不對,開始進行煞車。這是系統需要模擬的二階效應。」 這種對 二階效應 的建模,是區分「反應式AI」與「預判式AI」的分水嶺。一個不夠聰明的系統,會等待碰撞發生、速度劇變後才緊急煞車,導致更危險的後果。而端到端AI透過學習海量的真實物理互動,理解到「某種特定的失控姿態」必然導致「撞擊護欄並反彈」,從而做出超越人類反應的主動安全決策。 破解黑盒子:端到端系統的「可解讀性」 端到端AI長期以來最大的罩門,在於其「黑盒子」特性。如果一個單一網路決定所有事,當它犯錯時,工程師該如何除錯? 特斯拉的回應是:端到端不等於「無法觀測」。其策略是讓同一個模型承擔多重 輔助任務(auxiliary tasks)。雖然模型最終的 唯一 目的是輸出控制指令,但在訓練過程中,工程師會「提示」它同時預測各種「可解讀的中間標記」(interpretable intermediate tokens),藉此打開黑盒子,窺探模型的「內心世界」。 這就像在考核一個駕駛員時,除了看他是否能開到終點(控制任務),還會隨機提問他「剛才路過的交通標誌是什麼?」、「左側行人的意圖為何?」(輔助任務)。 特斯拉展示的「生成式高斯潑濺(Generative Gaussian Splatting)」技術變體,便是一個強大的輔助工具。傳統高斯潑濺技術需要數十分鐘優化,且在車輛直線運動的有限視角下效果很差。而特斯拉的版本能在約220毫秒內,利用車輛的即時影像,快速生成高解析度的3D語意場景。這使得工程師能以3D視角,直觀地檢視AI是否正確理解「障礙物是安全的」還是「危險的」。甚至,模型還能生成自然語言,解釋自己「為何」在此時選擇減速或轉向。 這些輔助任務就像鷹架,在模型建構階段提供支撐與 可解讀性,確保AI的「認知」與物理現實保持一致。一旦模型訓練成熟,這些鷹架在即時駕駛中可以被簡化甚至關閉,只保留最高效的「像素到動作」路徑,確保系統擁有可預測的 確定性延遲。 終極試煉場:用「神經網路世界模擬器」發動閉環戰爭 「評估是最後、也是最困難的挑戰。」 Ashok Elluswamy 坦言,即便擁有龐大的數據和可解讀的工具,端到端AI仍面臨最後一道關卡:評估。原因是「開迴路(open loop)」測試的侷限性。在開迴路中,模型只是觀看一段歷史影像並「預測」它會怎麼做,這就像在螢幕前玩模擬賽車。這種測試的成績可能非常漂亮,但「實際上路時可能表現就沒那麼好了」。因為在真實世界中,AI的 每一個動作(例如輕微的轉向)都會反過來改變整個世界的後續狀態(例如引發後車的反應),產生連鎖反應。 你無法在現實世界中反覆測試最危險的邊緣案例。那麼,該如何安全、高效地驗證AI在極端情況下的連鎖反應? 特斯拉的答案,是其當前最核心的戰略武器:神經網路世界模擬器。 這不是傳統意義上由工程師和美術師打造的電玩遊戲(如GTA)。特斯拉的模擬器本身,就是一個基於真實世界數據「學習」而來的 生成式AI。它以車輛過去的「狀態與動作」配對為養分,學會「在特定動作下,世界(包含所有八個攝影機的畫面)會如何演變」。 這個模擬器強大到令人畏懼: 高度一致性: 它可以同時生成八個攝影機、每秒高幀率的5K影像流,且所有畫面(例如鄰車的輪圈細節、遠處紅綠燈的變化)在跨攝影機視角下保持完美一致。 可控性: 這是關鍵。它不僅是播放影片,而是「以駕駛的動作為條件」來生成世界。當駕駛在模擬器中轉動方向盤,整個世界會即時、合理地反饋。 對抗性生成: 工程師可以在這個模擬器中「人工創造」新的危險。例如,調取一段過往的正常行車記錄,然後對模擬器下指令:「讓那輛原本直行的車,在特定時間點突然切入我的車道」。 這個世界模擬器,讓特斯拉得以發動一場低成本、高效率的 閉環(closed-loop)戰爭。他們不再需要冒著風險上路測試,而是可以在這個神經網路生成的「數位孿生世界」中,進行數百萬次高強度的 強化學習 與 對抗性測試,最終目標是實現「超人般的表現」(superhuman performance)。 終局:從Cyber Cab到Optimus,征服物理AI 當特斯拉展示其Robotaxi服務、展示車輛從工廠自動駕駛到客戶家中時,許多人以為這就是自駕的終局。但 Ashok Elluswamy 在 ICCV 的演講揭示,這一切只是序幕。 Cyber Cab(自動駕駛計程車)的目標是實現「比大眾運輸還便宜」的最低交通成本。這將創造巨大的現金流,但這筆錢的最終用途,並非停留在交通領域。 「我們為自動駕駛開發的這套技術,也能完美應用在其他類型的機器人上。」 Ashok Elluswamy 在演講的最後,展示了這套「世界模擬器」同樣在Optimus(人形機器人)身上運作的畫面,這證實了特斯拉的真正野心:它所打造的,根本不是一個「自動駕駛系統」,而是一個可擴展的、通用的 物理世界AI引擎。 汽車,只是這個AI引擎的第一個載體。它擁有輪子,能在結構化的道路上移動,是收集物理世界互動數據(包含光影、天氣、人類行為)最理想、最低成本的工具。而人形機器人Optimus,則是這個引擎的下一個載體。 特斯拉已經全力押注在機器人技術上。這場圍繞 端到端典範 與 神經網路模擬器 的豪賭,其目標遠非賣出更多的汽車,而是要成為第一個真正掌握通用物理AI的企業。自動駕駛的戰爭,只是這場更大戰役的第一個灘頭堡。

fox hsiao

29,516 просмотров • 11 месяцев назад