人形機器人的奇點還未到來:瓶頸在軟件,不在身體
走訪多家機械人公司後,判斷很清晰:人形機器人的瓶頸已不在硬件,而在軟件——部署要三到九個月,學一個動作要約二百行數據。代理時刻來不來,決定產業的兩種未來。

(由AI翻譯)
今天走訪了幾家機械人與人形機器人公司。最大的收穫,是對真正的瓶頸所在有了更清晰的判斷:差距已經不在「身體」,而在「軟件」。機器人,仍在等待屬於它的奇點。以下是幾點觀察。
硬件已經開始商品化。 單一公司或許仍能做出真正的硬件突破,但競爭對手——尤其是在中國——會迅速把差距追平。真正能築起護城河的,不是機器本身,而是高效、大規模製造它的能力。當業務需要擴張時,產能才是壁壘。
真正困難的,是現實世界裡的部署。 為一個實際應用場景把人形機器人部署到位,通常需要三到九個月。這項工作極度量身訂造:採集數據、訓練視覺—語言—動作(VLA)模型,再讓機器人的各套 AI 協同運作。哪怕只是教機器人做一件再普通不過的事——從倉庫貨架上拿起一個包裹——也需要約 200 行高質量的訓練數據,差不多是一位熟練工程師一週的工夫。市場上根本沒有開箱即用的方案。
最成熟的應用場景,並不是你以為的那些。 走得最前的是娛樂(會跳舞的機器人)與教育(大學的研究實驗室、能啟發學生的示範)。而物流與製造——商業上人人押注的場景——仍在發展之中,落地時還需要大量人手介入。
這些觀察反覆指向同一個主題:差距已不在「身體」,而在「軟件」。儘管各種物理 AI 模型(例如 VLA)已投入巨大資源,今天大部分的機器人工作,仍是把這些模型一塊塊手動拼湊起來,才能讓某件事在真實環境裡運轉。
我腦中一直有一個類比。大型語言模型存在了好一段時間,才真正變得有用——轉折點是那個「代理時刻」(agentic moment)。正是它,把一個聰明的文字預測器,變成能夠規劃、行動、自我修正並持續學習的系統。機器人還沒迎來這一刻。物理 AI 模型已經存在,但還沒有任何東西,能把它們融合成一個通用、會自我學習、自我修正的系統。衡量成熟度的標準其實很樸素:機器人學會一項任務所花的時間,不應該比人更長。
於是,未來似乎只有兩種走向。
第一種,代理時刻來臨。一個通用的「大腦」出現,人形機器人變得可以快速部署——以不亞於人類、甚至更快的速度學會新任務。
第二種,這個通用大腦被證明根本不可能。整個行業於是退回專門化的路線:方案供應商為每一個場景,量身打造高度客製的軟硬件一體系統。而如果結局是這樣,它會引出一個更尖銳的問題——我們究竟還需不需要「人形」這個形態?如果反正樣樣都要量身訂造,何不乾脆造出最適合該任務的任何形態?
我們最終走向哪一種未來,完全取決於機器人能否找到屬於它的代理時刻。而今天,它還沒有。