刊於《信報》,2026年6月1日
AI價值不在模型性能而在應用
許佳龍
科大協理副校長(學術發展);資訊、商業統計及營運學系講座教授;艾禮文家族商學教授
筆者在本欄上篇文章分析了史丹福大學人類中心人工智能研究所(HAI)所發布的《2026年人工智能指數報告》(Artificial Intelligence Index Report 2026‧下簡稱《報告》),扼要論述了當前全球人工智能(AI)產業的主要發展趨勢,其巧拙兩面性以及數據質量存在的隱憂。
另外值得討論的焦點,一是有關大模型性能的優劣比拼和追逐問題,尤其內地朋友與筆者討論時,都提出「究竟那一個大模型性能更好」?「那一個應用更得心應手」?大家不斷追求或不遺餘力地去探究、沉醉於追逐和比較模型性能孰優孰劣。
模型性能與效率差異不大
筆者認為,這種大模型性能高下的探究和優劣追逐,意義並不大。報告提出一項研究發現與筆者的觀點和判斷相當脗合,即目前大模型之間的性能和表現效率,彼此相差不大。從評分角度看,個別模型的得分差距相當有限。據報告資料,頂級模型的性能正在趨於一致。這項研究發現與筆者的研究和觀察相當一致,「在Arena排行榜和基準測試中,位於前列的4家公司,其Elo積分(借鑒了國際象棋等級分)相差不到25分。截至2026年3月,Anthropic(1,503)、xAI(1,495)、Google(1,494)、OpenAI(1,481)、阿里巴巴(1,449)和DeepSeek(1,424),均位列Arena Elo積分榜前列位置」(頁71)。
因此,大家在使用大模型時,實在不必刻意追求那個性能更好、那個應用更得心應手,反而是應該着意這個模型如何直接地嵌入到自身的工作任務,促使我們的能力有所提升,具體落實應用,這無疑是更根本性的問題。
物理世界表現不濟
此外,雖然目前大模型和機器人的發展如火如荼,一片火熱,但技術應用到真實世界的場景,目前仍然相對有限。據報告資料,在現實物理世界中,AI機器人進入這個世界而能夠圓滿地完成任務,表現令人失望。報告發現,儘管機器人在受控環境中表現出色,但在大多數家務任務中仍然經常失敗,只能成功完成12%的真實家務任務,凸顯人工智能距離掌握物理世界,還有很長的路要走。在RLBench測試中(RLBench 是一個大規模的機器人學習基準測試與仿真的環境),於軟體的模擬環境中之機器人,其操作成功率雖然達到89.4%,但可預測的實驗室環境,與不可預測的家庭環境之間存在著巨大的差距(頁 72)。報告強調了這種模擬實驗環境與真實物理世界中的差異性,我們從機器人僅能完成12%的家務任務中,即可見其一斑。
聚焦性能非可取發展方向
很顯然,AI進入真實物理世界中完成任務,確實還有很大的改善空間,需要進一步把機器人的功能,有效套用到物理世界中的任務上,協助人類解決更多日常生活上的應用。
對於人工智能和機器人的未來發展,筆者認為,智能體的發展若聚焦開發、或比拼追逐大模型性能並非一個可取方向,反而集中把AI技術或機器人如何與機械物理體系/世界配合,令我們能夠在日常生活上,得以大量地應用到AI和機器人技術,完成過往人類需要使用人手,去直接操控物理世界中的一些工作任務,這個發展方向更值得我們匯聚資源去探索、發掘和投資。
最後,筆者提出的討論焦點是,在若干不同專業範圍,愈來愈多應用AI模型。但這些專業應用很多並非運用大模型,反而是為專業個別業務開拓出來的應用,如醫療、金融和研究等專業範疇,專門為其專業工作任務而訓練出來。報告提到,「人工智能模型正在擴展到專業領域,在稅務、抵押貸款處理、公司財務和法律推理等評估中,其性能準確率在60%到90%之間」(頁71)。
AI真正價值在於應用
此外,「用於科學的人工智能模型可有超越人類科學家的表現,但模型愈大並非總是表現愈好。前沿模型在 Chem Bench 測試中,平均表現優於人類化學家,但在天文物理學的可重複性測試中,得分卻低於 20%;在地球觀測問題上的得分亦低於 33%。……大多數用於科學的基礎人工智能模型都來自跨部門合作,這與通用人工智能領域由產業主導的格局截然不同」(頁10)。
可以說,人工智能的應用,目前已覆蓋到相當寬濶的界別範疇,而且普及速度「前所未有」——生成式人工智能在三年內就達到了53%的人口普及率,比個人電腦或網路的普及速度更快(頁10),但普及的應用顯然並非一個通用大模型所能夠處理與應對。因此,在大模型性能和效率差異不大的情況下,與其不斷追逐拓優大模型,倒不如聚焦把AI智能內嵌到個別專業/產業的需要和任務之中,在物理世界中得到實實在在的應用,這樣才能充份體現出AI技術的具體價值。