機器人的「代理時刻」還未到來
走訪幾家機械人與人形機器人公司後,真正的瓶頸已經清晰:差距不再在「身體」,而在「軟件」。機器人,仍在等待屬於它的代理時刻。
(由AI翻譯)
今天走訪了幾家機械人與人形機器人公司,對於真正的瓶頸所在,我有了更清晰的判斷。以下是一些觀察。
硬件已經開始商品化。 一家公司或許仍能做出真正的硬件突破,但競爭對手——尤其是在中國——會很快把差距追平。真正能築起護城河的,不是機器本身,而是高效、大規模製造它的能力。當業務需要擴張時,產能才是壁壘。
真正困難的,是在現實世界中的部署。 為一個實際應用場景把人形機器人部署到位,通常需要三到九個月。這項工作極度量身訂造:採集數據、訓練視覺—語言—動作(VLA)模型,再讓機器人的 AI 協同運作。要教會機器人一件再普通不過的事——例如從倉庫貨架上拿起一個包裹——你可能需要約 200 行高質量的訓練數據,差不多是一位熟練工程師一週的工夫。市場上根本沒有開箱即用的方案。
真正成熟的應用場景,並不是你以為的那些。 娛樂(會跳舞的機器人)與教育(大學的研究實驗室、能啟發學生的示範)走得最前。而物流與製造——那些商業上人人押注的場景——仍在發展之中,落地時需要大量人手介入的工作。
反覆出現的主題是:差距已不在「身體」,而在「軟件」。儘管在各種物理 AI 模型(例如 VLA)上投入了巨大資源,今天大部分機器人工作,仍是把這些模型一塊塊手動拼湊起來,才能讓某件事在真實環境裡運轉。
我一直在想的一個類比是這樣的。大型語言模型存在了好一段時間,才真正變得有用——轉折點是那個代理時刻(agentic moment),正是它把一個聰明的文字預測器,變成能夠規劃、行動、自我修正並持續學習的系統。機器人還沒迎來這一刻。物理 AI 模型已經存在,但還沒有任何東西把它們融合成一個通用、能自我學習、自我修正的系統。衡量成熟度的標準其實很樸素:機器人學會一項任務,所花的時間不應該比人更長。
於是,未來似乎會走向兩種可能之一。
第一種,代理時刻來臨。一個通用的「大腦」出現,人形機器人變得能快速部署——以不亞於人類、甚至更快的速度學會新任務。
第二種,這個通用大腦被證明根本不可能。整個行業於是退回到專門化的路線:方案供應商為每一個場景,量身打造高度客製的軟硬件一體系統。而如果結局是這樣,它就會引出一個更尖銳的問題——我們究竟還需不需要「人形」這個形態?如果反正都要量身訂造,那就乾脆造出最適合該任務的任何形態。
我們最終走向哪一種未來,完全取決於機器人能否找到屬於它的代理時刻。而今天,它還沒有。