刊於《信報》,2026年5月25日
AI呈巧拙兩面性 數據質量存隱憂
許佳龍
科大協理副校長(學術發展);資訊、商業統計及營運學系講座教授;艾禮文家族商學教授
史丹福大學人類中心人工智能研究所(HAI)不久前發布了《2026年人工智能指數報告》(Artificial Intelligence Index Report 2026‧下簡稱《報告》),揭示全球人工智能(AI)產業的最新發展趨勢。
報告有幾項結論,筆者認為都是意料之內。例如報告開宗明義指出,人工智能(AI) 的發展不僅沒有停滯不前,反而在加速,觸及更多人;發展領頭的國家,仍以美國和中國為首。報告指出,中美兩國的AI模型效能差距基本縮小,意味全球人工智能產業發展,美國不再「獨領風騒」,據報告資料,截至今年3月,在模型效能測試中,美國模型Claude Opus 4.6稍高於中國模型Dola-Seed-2.0-Preview,但得分差距僅2.7%,呈現多元發展格局,無疑是一件好事。
聰明笨拙兩面性制約
報告同時指出,AI經過多年迭代發展,當下使用更巨大算力和數據訓練出來的模型,依然帶有顯著缺陷。例如,谷歌的先進模型Gemini Deep Think在2025年國際數學奧林匹克競賽中獲得35分(金牌),在4.5小時的時限內,使用自然語言完成了端到端的計算,比2024年獲得28分(銀牌)有所提高,但在Clock Bench測試中,正確讀取「模擬時鐘」(「指針式鐘面」)的準確率卻僅為50.1%,而人類的準確率則為90.1%(報告頁71),呈現了一種研究人員稱之為「鋸齒狀智能」(jagged intelligence)現象。所謂「鋸齒狀智能」(jagged intelligence),是指在某些任務上能力超卓,聰明絕頂,但在另一些看似簡單的任務上卻蠢純如豬,表現不濟,能力呈「鋸齒狀」分布。
看深一層,人類根據自身的目標訓練出來的大模型,在某些界別上,效能表現優秀,展示出色的邏輯推理能力,但在人類日常生活的物理世界基本任務中,表現笨拙,這是AI 的典型問題。因為目前生成式人工智能的「通用性」,其面對的,是一個有無數錯綜複雜工作任務的「大千世界」,要每一項工作任務都能圓滿高效完成,實在需要長時間磨練,不可能一蹴而成。就像人類成長過程,兒童於成長階段總會犯錯,能力有所不逮,但隨着學習吸收知識,智能生長與厚積,增加經驗之後,便可逐步邁向「漸入佳境」的階段。目前,人工智能的發展,顯然尚處於學習與成長的階段。
學習過程除錯與經驗積累
然而在成長過程中,有一點非常重要。正如兒童階段的成長,在學習過程中,很視乎我們給他們提供什麼養份,他們從置身環境中所目睹和得到什麼經驗,AI模型的學習和訓練,本質上與人類成長過程有相類之處。
如今的大模型,無論其經歷了多少次迭代,模型成長或進步都有賴訓練過程,而訓練過程基本上有兩個維度,一是採用了什麼數據和經驗;二是採用什麼訓練方法。
在採用什麼數據方面,筆者注意到一個有趣現象——即採用人工(人手)生成的數據,對比採用AI生成的數據。筆者記得在本欄曾分析AI大模型的訓練過程,指出訓練AI採用了海量數據,AI學習模仿這些數據去反推出一個模型,使這個模型能夠「懂得」模仿人類進行自然語言寫作、或生成一些新內容。在學習過程中,不斷讀取人類在過去所寫的海量文獻資料、圖片和視頻等。這些文獻資料數據有兩種類別,一是出自人類手寫的(真實世界的資料數據,高質量),另一種資料內容,尤其是網絡上的資料數據,很多是由人工智能生成的(對眾多海量人工資料進行模仿所合成的推理特性數據)。
人工數據勝合成數據一籌
問題是:若然訓練模型所注入海量的、真正經由人工所生成的文獻資料已告枯竭,我們要進一步優化/強化模型的功能,需要再增加注入什麼數據?報告對此有着墨之處,並提及有人在研究可否採用那些AI生成的「合成數據」(Synthetic Data),來作進一步優化訓練,使模型的效能更為強大?不過,報告的斷論指出,這些「合成數據」在預訓練中仍無法完全取代真實數據(頁 14),換言之,這代表人類目前進行大模型訓練依然受到高質內容有限的掣肘。若果高質素內容數據未來無法源源增加,我們便會陷入一個「下行漩渦」,因為當大模型的數據都是以AI生成的「合成數據」支撐,則由AI生成的數據來訓練AI自身,結果一定無法形成具進步的突破性發展。筆者認為這是報告當中一個對AI產業不利發展的訊息。這一點也正正是目前政府或業界考慮進一步推動AI產業發展時,需要關注的要點。
合成數據可發揮微調效果
對於優化模型的訓練,「合成數據」促成模型進步的作用不及真實數據,但報告也同時指出,「合成數據」內容在個別已告完成訓練的模型中,起到正面性微調效果。亦即是說,當我們完成訓練一個高效能大模型,再要這個模型進行一些個別工作任務,或者我們訓練那些相對較小的模型,去進行一些專門性任務,這些「合成數據」便可發揮助力作用。換句話說,當模型所設計的工作任務帶有「利基」(niche)性質,這類「合成數據」便可派上用場,有其價值。
至於大模型開發商或用戶對模型性能優劣的比拼和追逐,這種比拼與追逐對AI產業發展不見得有利,筆者另文討論。