刊于《信报》,2026年5月25日

AI呈巧拙两面性 数据质量存隐忧

许佳龙

科大协理副校长(学术发展);信息、商业统计及营运学系讲座教授;艾礼文家族商学教授

史丹福大学人类中心人工智能研究所(HAI)不久前发布了《2026年人工智能指数报告》(Artificial Intelligence Index Report 2026‧下简称《报告》),揭示全球人工智能(AI)产业的最新发展趋势。

报告有几项结论,笔者认为都是意料之内。例如报告开宗明义指出,人工智能(AI) 的发展不仅没有停滞不前,反而在加速,触及更多人;发展领头的国家,仍以美国和中国为首。报告指出,中美两国的AI模型效能差距基本缩小,意味全球人工智能产业发展,美国不再「独领风騒」,据报告资料,截至今年3月,在模型效能测试中,美国模型Claude Opus 4.6稍高于中国模型Dola-Seed-2.0-Preview,但得分差距仅2.7%,呈现多元发展格局,无疑是一件好事。

聪明笨拙两面性制约

报告同时指出,AI经过多年迭代发展,当下使用更巨大算力和数据训练出来的模型,依然带有显著缺陷。例如,谷歌的先进模型Gemini Deep Think2025年国际数学奥林匹克竞赛中获得35分(金牌),在4.5小时的时限内,使用自然语言完成了端到端的计算,比2024年获得28分(银牌)有所提高,但在Clock Bench测试中,正确读取「模拟时钟」(「指针式钟面」)的准确率却仅为50.1%,而人类的准确率则为90.1%(报告页71),呈现了一种研究人员称之为「锯齿状智能」(jagged intelligence)现象。所谓「锯齿状智能」(jagged intelligence),是指在某些任务上能力超卓,聪明绝顶,但在另一些看似简单的任务上却蠢纯如猪,表现不济,能力呈「锯齿状」分布。

看深一层,人类根据自身的目标训练出来的大模型,在某些界别上,效能表现优秀,展示出色的逻辑推理能力,但在人类日常生活的物理世界基本任务中,表现笨拙,这是AI 的典型问题。因为目前生成式人工智能的「通用性」,其面对的,是一个有无数错综复杂工作任务的「大千世界」,要每一项工作任务都能圆满高效完成,实在需要长时间磨练,不可能一蹴而成。就像人类成长过程,儿童于成长阶段总会犯错,能力有所不逮,但随着学习吸收知识,智能生长与厚积,增加经验之后,便可逐步迈向「渐入佳境」的阶段。目前,人工智能的发展,显然尚处于学习与成长的阶段。

学习过程除错与经验积累

然而在成长过程中,有一点非常重要。正如儿童阶段的成长,在学习过程中,很视乎我们给他们提供什么养份,他们从置身环境中所目睹和得到什么经验,AI模型的学习和训练,本质上与人类成长过程有相类之处。

如今的大模型,无论其经历了多少次迭代,模型成长或进步都有赖训练过程,而训练过程基本上有两个维度,一是采用了什么数据和经验;二是采用什么训练方法。

在采用什么数据方面,笔者注意到一个有趣现象——即采用人工(人手)生成的数据,对比采用AI生成的数据。笔者记得在本栏曾分析AI大模型的训练过程,指出训练AI采用了海量数据,AI学习模仿这些数据去反推出一个模型,使这个模型能够「懂得」模仿人类进行自然语言写作、或生成一些新内容。在学习过程中,不断读取人类在过去所写的海量文献数据、图片和视频等。这些文献数据数据有两种类别,一是出自人类手写的(真实世界的数据数据,高质量),另一种资料内容,尤其是网络上的数据数据,很多是由人工智能生成的(对众多海量人工数据进行模仿所合成的推理特性数据)。

人工数据胜合成数据一筹

问题是:若然训练模型所注入海量的、真正经由人工所生成的文献资料已告枯竭,我们要进一步优化/强化模型的功能,需要再增加注入什么数据?报告对此有着墨之处,并提及有人在研究可否采用那些AI生成的「合成数据」(Synthetic Data),来作进一步优化训练,使模型的效能更为强大?不过,报告的断论指出,这些「合成数据」在预训练中仍无法完全取代真实数据(页 14),换言之,这代表人类目前进行大模型训练依然受到高质内容有限的掣肘。若果高质素内容数据未来无法源源增加,我们便会陷入一个「下行漩涡」,因为当大模型的数据都是以AI生成的「合成数据」支撑,则由AI生成的数据来训练AI自身,结果一定无法形成具进步的突破性发展。笔者认为这是报告当中一个对AI产业不利发展的讯息。这一点也正正是目前政府或业界考虑进一步推动AI产业发展时,需要关注的要点。

合成数据可发挥微调效果

对于优化模型的训练,「合成数据」促成模型进步的作用不及真实数据,但报告也同时指出,「合成数据」内容在个别已告完成训练的模型中,起到正面性微调效果。亦即是说,当我们完成训练一个高效能大模型,再要这个模型进行一些个别工作任务,或者我们训练那些相对较小的模型,去进行一些专门性任务,这些「合成数据」便可发挥助力作用。换句话说,当模型所设计的工作任务带有「利基」(niche)性质,这类「合成数据」便可派上用场,有其价值。

至于大模型开发商或用户对模型性能优劣的比拼和追逐,这种比拼与追逐对AI产业发展不见得有利,笔者另文讨论。

Read Article