由著名AI科學家李飛飛創辦的World Labs周二(9/1)正式發表新一代世界模型Atlas,這是一款從零開始預訓練的「全模態模型」,可原生處理文字、圖像、影片與3D四種資料型態。World Labs表示,Atlas將驅動未來版本的Marble及其他產品,標誌著空間智能技術邁入新階段。
World Labs是由李飛飛、Justin Johnson、Christoph Lassner與Ben Mildenhall於2024年共同創立,定位為空間智慧公司,專注於打造前沿世界模型,以讓AI能夠感知、生成、推理並與3D世界互動。今年2月,該公司完成10億美元新一輪融資,估值約50億美元。
Atlas具備四大核心能力,分別為相機控制生成、空間重建、時空模擬與圖像生成。其中,相機控制生成指的是用戶可像導演一樣直接指定鏡頭位置與角度,Atlas便能根據1到6張參考圖像,生成最長1分鐘、1440p解析度的影片,畫面不僅與原始圖像一致,還能補足照片中看不到的區域。
在空間重建上,Atlas可處理1張到數十張,甚至超過100張的輸入圖像。輸入的照片越多,模型掌握的資訊就越完整,重建結果也越接近真實場景;反之,若僅輸入2至3張照片,Atlas則會運用其豐富的世界知識,「腦補」出未拍到的部分,適合快速生成與概念設計。
第三項能力是時空模擬。Atlas能同時理解空間結構與時間變化。例如,傳統拍攝「子彈時間」效果需要在場景周圍架設數十臺專業攝影機同步拍攝,成本極高;Atlas僅需3到5臺普通手機從不同角度拍攝同一場景,便能重建出完整的3D空間,讓用戶自由定格時間、從任意角度重新觀看畫面。
Atlas亦可根據文字提示生成高品質圖片與360°全景圖,能處理複雜指令、精準呈現文字,並支援多種視覺風格,從寫實到插畫皆可勝任。
Atlas的核心設計為空間脈絡(Spatial Context),它是一款多模態的自迴歸擴散Transformer,所有輸入的內容,不管是文字、圖像、影片或是3D,都會被整合到一個共享的3D空間,每張圖像和深度圖都被錨定在3D空間中的具體位置。Atlas根據此一脈絡生成後續內容,在3D空間中與已見資訊保持連貫一致,並能推想視野之外的景象。
在基準測試上,第三方人類評審盲測顯示,Atlas於相機控制生成任務上對各主流模型的勝率均超過七成五,最高達94%。在3D重建任務上,Atlas於多個標準基準測試中的平均誤差僅8.6×10⁻³,優於多款專門為3D重建訓練的開源模型,展現出通用模型的強大實力。
World Labs的首款商用產品Marble於2025年11月推出,最新的Atlas現僅開放合作夥伴存取。
Comments (0)