刊于《信报》,2026年6月1日

AI价值不在模型性能而在应用

许佳龙

科大协理副校长(学术发展);信息、商业统计及营运学系讲座教授;艾礼文家族商学教授

笔者在本栏上篇文章分析了史丹福大学人类中心人工智能研究所(HAI)所发布的《2026年人工智能指数报告》(Artificial Intelligence Index Report 2026‧下简称《报告》),扼要论述了当前全球人工智能(AI)产业的主要发展趋势,其巧拙两面性以及数据质量存在的隐忧。

另外值得讨论的焦点,一是有关大模型性能的优劣比拼和追逐问题,尤其内地朋友与笔者讨论时,都提出「究竟那一个大模型性能更好」?「那一个应用更得心应手」?大家不断追求或不遗余力地去探究、沉醉于追逐和比较模型性能孰优孰劣。

模型性能与效率差异不大

笔者认为,这种大模型性能高下的探究和优劣追逐,意义并不大。报告提出一项研究发现与笔者的观点和判断相当脗合,即目前大模型之间的性能和表现效率,彼此相差不大。从评分角度看,个别模型的得分差距相当有限。据报告数据,顶级模型的性能正在趋于一致。这项研究发现与笔者的研究和观察相当一致,「在Arena排行榜和基准检验中,位于前列的4家公司,其Elo积分(借鉴了国际象棋等级分)相差不到25分。截至20263月,Anthropic1,503)、xAI1,495)、Google1,494)、OpenAI1,481)、阿里巴巴(1,449)和DeepSeek1,424),均位列Arena Elo积分榜前列位置」(页71)。

因此,大家在使用大模型时,实在不必刻意追求那个性能更好、那个应用更得心应手,反而是应该着意这个模型如何直接地嵌入到自身的工作任务,促使我们的能力有所提升,具体落实应用,这无疑是更根本性的问题。

物理世界表现不济

此外,虽然目前大模型和机器人的发展如火如荼,一片火热,但技术应用到真实世界的场景,目前仍然相对有限。据报告资料,在现实物理世界中,AI机器人进入这个世界而能够圆满地完成任务,表现令人失望。报告发现,尽管机器人在受控环境中表现出色,但在大多数家务任务中仍然经常失败,只能成功完成12%的真实家务任务,凸显人工智能距离掌握物理世界,还有很长的路要走。在RLBench测试中(RLBench 是一个大规模的机器人学习基准检验与仿真的环境),于软件的仿真环境中之机器人,其操作成功率虽然达到89.4%,但可预测的实验室环境,与不可预测的家庭环境之间存在着巨大的差距(页 72)。报告强调了这种模拟实验环境与真实物理世界中的差异性,我们从机器人仅能完成12%的家务任务中,即可见其一斑。

聚焦性能非可取发展方向

很显然,AI进入真实物理世界中完成任务,确实还有很大的改善空间,需要进一步把机器人的功能,有效套用到物理世界中的任务上,协助人类解决更多日常生活上的应用。

对于人工智能和机器人的未来发展,笔者认为,智能体的发展若聚焦开发、或比拼追逐大模型性能并非一个可取方向,反而集中把AI技术或机器人如何与机械物理体系/世界配合,令我们能够在日常生活上,得以大量地应用到AI和机器人技术,完成过往人类需要使用人手,去直接操控物理世界中的一些工作任务,这个发展方向更值得我们汇聚资源去探索、发掘和投资。

最后,笔者提出的讨论焦点是,在若干不同专业范围,愈来愈多应用AI模型。但这些专业应用很多并非运用大模型,反而是为专业个别业务开拓出来的应用,如医疗、金融和研究等专业范畴,专门为其专业工作任务而训练出来。报告提到,「人工智能模型正在扩展到专业领域,在税务、抵押贷款处理、公司财务和法律推理等评估中,其性能准确率在60%90%之间」(页71)。

AI真正价值在于应用

此外,「用于科学的人工智能模型可有超越人类科学家的表现,但模型愈大并非总是表现愈好。前沿模型在 Chem Bench 测试中,平均表现优于人类化学家,但在天文物理学的可重复性测试中,得分却低于 20%;在地球观测问题上的得分亦低于 33%……大多数用于科学的基础人工智能模型都来自跨部门合作,这与通用人工智能领域由产业主导的格局截然不同」(页10)。

可以说,人工智能的应用,目前已覆盖到相当宽阔的界别范畴,而且普及速度「前所未有」——生成式人工智能在三年内就达到了53%的人口普及率,比个人计算机或网络的普及速度更快(页10),但普及的应用显然并非一个通用大模型所能够处理与应对。因此,在大模型性能和效率差异不大的情况下,与其不断追逐拓优大模型,倒不如聚焦把AI智能内嵌到个别专业/产业的需要和任务之中,在物理世界中得到实实在在的应用,这样才能充份体现出AI技术的具体价值。

Read Article