Meta 推出 SceneScript AI 視覺模型,利用可編程語言實時預測建立 3D 場景

據 Meta 公司官方新聞稿,該公司開髮了一款名爲“SceneScript”的視覺模型,該模型號稱能夠使用可編程語言來快速“建立”場景,實時推斷房間幾何形狀,並將相關數據轉換爲建築學層麵的近似值。

Meta 聲稱,相關方法能夠高效且輕量地建立室內 3D 模型,號稱“隻需要數 KB 的內存即可生成清晰且完整的幾何形狀”,並且相關形狀數據具有“可解釋性”,用戶可以輕鬆閱讀和編輯這些數據表示。

外媒注意到,開髮人員藉鑒了大語言模型“預測單詞”的方法來開髮 SceneScript,以 Llama 模型爲例,該模型可以根據前麵的單詞來預測句子的下一個單詞,例如輸入句子“The cat sat on the…”,模型會預測下一個單詞可能是“mat”或“floor”。而 SceneScript 運用了相同的概唸,即通過前序輸入內容推出後文,並使用這些建築學層麵的描述重建出複雜的室內 3D 環境。