阿波羅網王篤若報導/繼晶片之後,中共AI又撞上另一堵牆!
儘管美國封鎖先進運算晶片占據了新聞頭條,但中共AI專家卻日益警告,事實恐怕會證明,優質數據枯竭,可能成為國家科技雄心的下一個主要瓶頸,而這可能是無法輕易靠硬體替代方案來解決的問題。
在打造下一代人工智慧模型的高風險競賽中,中共正進入一個關鍵新階段——一個較不顯眼、但遠遠更具存亡意義的威脅正逐漸浮現,那就是高質量訓練數據嚴重短缺。
據中共大外宣《南華早報》8日報導,這挑戰正同時衝擊太平洋兩岸的AI巨頭,部分美國企業已採取積極手段以保持領先。美國研究機構Epoch AI表示,全球高質量、公開可用的人類生成文本供應,可能會在未來6年內耗盡;OpenAI共同創辦人卡帕西也警告,2030年結束前將出現"數據牆",若沒有新鮮可靠的資訊餵養,模型能力可能陷入停滯。美國頂尖實驗室正大手筆投資挖掘線下的人類知識,引發了激烈的倫理爭論——今年1月《華盛頓郵報》報導的法庭文件顯示,Anthropic在亞馬遜支持下啟動"巴拿馬計劃",斥資數千萬美元收購數百萬本實體書,拆除裝訂、掃描每一頁後再加以丟棄,此舉引發作家、檔案管理員及文化資產保存者的強烈譴責,指控科技公司把人類遺產當成可拋棄的原料;Anthropic一名代表則回應,其數據獲取計劃"從未購買並銷毀'稀有'或'古董'書"。
而對中共來說,即將到來的"數據牆"構成了更獨特的威脅。中國信息通信研究院院長余曉暉指出:"人工智慧創新的競爭,不僅是模型和算力的競爭,更是高質量數據供給體系的競爭。"網絡追蹤機構W3Techs本月數據顯示,英文占全球網絡內容近一半,中文卻僅占1.3%,遠遠落後西班牙文的6%、德文的5.9%與日文的5%。
北京正積極將數據視為核心戰略資產——中共國家數據局6月公布一項全面的全國性計劃,目標是提升高質量AI訓練數據的供應、流通與商業化。中共電腦科學家指出,國家不能只依賴標準網絡爬取,而必須系統性推動數位化龐大、尚未開發的離線資產。清華大學人工智慧研究院常務副院長孫茂松上個月在《光明日報》撰文強調:"語料庫在大語言模型發展中扮演關鍵角色,已演變成支撐AI能力疊代的核心要素。沒有語料庫,就沒有語言大模型。"
阿波羅網評論員王篤然指出:"中文網絡內容占比不到2%,這個數字戳破了一個假象——中共這些年拼命封鎖、審查、刪帖,砍掉的不只是言論自由,也順手砍斷了自己AI崛起最需要的原材料。""審查刪掉的每一條帖子,都是餵不進AI模型的一粒沙。"