這種系統可以預測未來,生成極為真實的
2022-10-16 14:03:51 來源:
(原標題:這種系統可以預測未來,生成極為真實的視頻)
![]()
一種新的人工智能系統能夠用靜態圖像生成短視頻,這些視頻能夠模擬接下來發生的事,這就好像人類想象接下來將會看到的情景一樣。
人類能夠直覺地理解世界運作的方式。這使得人比機器更容易預測事件接下來將如何發展。一張靜態圖像中的物體可以用多種不同方式運動,或者和其他物體發生作用,這讓機器很難做出類似的預測。不過,一種新型的深度學習系統(deep-learning system)創造出的短視頻卻能夠讓人信以為真。和真實的視頻片段相比,在20%的情況下,人類更相信它創造出的視頻。
該深度學習系統的發明者是麻省理工學院(MIT)的研究人員。他們讓兩種神經網絡互相競爭,其中一個要區分真實的視頻和機器創造的視頻,而另一個則要創造出能夠打敗第一個系統的近乎真實的視頻。
這種方法叫做“生成式對抗網絡”(generative adversarial network,GAN),兩個系統互相競爭,生成了愈發真實的視頻。當研究人員讓亞馬遜的Mechanical Turk網絡眾包平臺上征集的人員從兩種視頻中挑選真實的視頻時,這些人在20%的情況下挑選了機器合成的,而不是真實的視頻。
早期的問題
但是,剛剛入行的電影導演還不用擔心這種機器會搶了自己的飯碗,因為這些視頻的長度只有1~1。5秒,而且像素只有64 x 64。研究人員認為,這種方法最終能夠幫助機器人和自動駕駛汽車在復雜的環境中導航,也能幫助它們和人類互動,或者讓Facebook為視頻自動添加描述內容的標簽。
“我們的算法會預測未來,然后生成極為真實的視頻。這說明在某種程度上它能夠理解現在發生的事,”該研究的主要負責人,MIT計算機科學和人工智能實驗室的博士研究生Carl Vondrick表示,“我們的研究是一項振奮人心的進步,它說明計算機科學家能夠讓機器具有更高級的情境理解能力。”
研究人員表示,這種系統還可以在沒有人指導的情況下進行學習。這意味著該系統進行訓練所用的200萬個視頻(大約等于一年的長度)并不需要人類的標記。這能極大地減少訓練所需的時間,并能讓其適應新數據。
在西班牙巴塞羅那召開的神經信息處理系統大會(Conference and Workshop on Neural Information Processing Systems)上,研究人員展示了他們的研究成果,解釋了他們是怎樣用海灘、火車站、醫院和高爾夫球場的視頻對該系統進行訓練的。
“我們發現,早期的原型系統面臨的難點在于,模型預測視頻的背景將要變形扭曲,” Vondrick表示。為了克服這個問題,他們調整了設計,讓系統學習獨立的靜態背景模型和動態前景模型,然后再把它們合起來制成視頻。
AI導演
用人工智能(AI)來從無到有地創造視頻,在MIT的這個團隊之前也有人嘗試過。但是之前的方法往往逐幀逐幀地構造視頻,這樣容易讓錯誤從早期開始逐漸累加。他們的新方法則是同時處理整個場景,一般來說會一次性產生32幀視頻。
GAN的發明者,非營利機構OpenAI的科學家Ian Goodfellow表示,這個領域的早期研究并不能產生和現在這個方法一樣清晰的圖像和動作。但是他補充道,谷歌旗下的DeepMind AI上個月也公布了一種新方法,這個方法叫做視頻像素網絡(Video Pixel Networks,VPN),它也能產生清晰的圖像和動作。
“和GAN相比,VPN更容易訓練,不過生成視頻所花費的時間也更長,”他表示,“VPN每次生成單個像素,而GAN卻能同時生成很多像素。”
Vondrick也指出,他們的方法主要利用的是更加難處理的數據,比如從網絡上隨便搜集的視頻;而VPN的訓練視頻是經過特別設計、內容特定的視頻,這些視頻的內容主要是跳動的數字或是機械臂。
不過這些研究人員表示,目前的結果還遠不夠完美。前景中的物體常常變得太大,而人類在視頻中卻常常會變成模糊的一團。有時候場景中的物體會無端消失,而有時候卻會出現一些不知從哪兒冒出來的東西。
“這個計算機模型對世界是沒有任何預設的,它必須學習人的樣子、物體移動的方式和結果,”Vondrick表示,“我們的模型還沒有完全學成。如果能擴充它理解如物體之類的高級概念的能力,那么生成的視頻質量將會顯著提高。”
Vondrick表示,未來的另一個挑戰是生成更長的視頻,因為這就需要系統花更長的時間去追蹤場景物體之間的更多關系。
“要完成這一任務,可能需要人類的輸入來幫助系統理解場景中的元素,因為讓它自己學習會比較艱難。”
撰文Edd Gent
翻譯徐寒易
-
“半機械人”大腦電極有望幫助癱瘓者再次行走
網易科技訊2月23日消息,據國外媒體報道,美國的一個研究人員團隊利用玻璃碳而非常用的鉑打造出信噪比提升兩倍、光滑度提升10倍的
2022-10-16 12:37
-
Jawbone產品高層再出走手環元老前途撲朔迷離
在大約四五年前,Jawbone憑借自己的UP手環成功讓世界認識到了這個音響公司,從那時起,世人對其印象更多是運動手環生產商,盡管其已在音響
2022-10-15 17:50
-
特斯拉承認黑人員工比例不足:公司僅10%員工是非裔
當地時間上周五,美國電動汽車制造商特斯拉發布首份多樣化、公平和包容性影響(The Diversity, Equity and Inclusion Impact)報告
2022-10-15 05:37
-
透視城市“生命線”MapGIS地下管線三維建模工具
(原標題:基于UE4 的三維GIS游戲引擎 ---M3D在游戲引擎上的應用) 城市是繁忙的,昨夜的浮塵還未落定,新一天的晨曦又接替了燈光
2022-10-15 01:30
-
愛芯智眸?AI-ISP正式發布:暗光環境成像性能佳,加快智能消費場
(原標題:愛芯智眸®AI-ISP正式發布:暗光環境成像性能佳,加快智能消費場景應用) 作為一年一度的AI行業頂級盛會,2022世界人工
2022-10-14 22:50
-
無人駕駛技術將終結疲勞駕駛?現在看來還早的很
(原標題:Autonomous cars could end drowsy driving, but don’t hold your breath) 網易科技訊 11月20日消息,據
2022-10-14 15:54








