李飞飞团队发布《2025年人工智能指数报告》,中国人对人工智能竟最为乐观?

Published2025年4月14日


2025年4月8日,由李飞飞联合领导的斯坦福大学以人为本人工智能研究(Stanford HAI)发布了《2025年人工智能指数报告》(Artificial Intelligence Index Report 2025)(后台回复获取全文报告)。

这份456页的报告,用丰富的图表和数据,分析了2024年全球人工智能行业的发展情况,涵盖研发、技术性能、经济影响、社会生活、人工智能治理等多个关键领域。

值得一提的是,报告内容呈现了不少亮点,其中有,中美顶级模型性能差距已经从2023年的20%缩至0.3%;开闭源差距从8%缩小到了1.7%;中国是对人工智能态度最为乐观的国家;全球科技巨头进入竞争白热化,近90%的著名AI模型来自行业。

此外,复杂推理、AI滥用导致的社会危害,仍旧是人工智能领域悬而未决的难题。

根据斯坦福HAI发布的《2025年人工智能指数报告》两篇相关博文,2025年人工智能领域的发展可以提取为十二大亮点,具体可以分为人工智能行业发展、人工智能与社会生活、人工智能治理。


01 人工智能行业:中美差距缩小、模型成本暴降、90%知名模型来自企业研发


AI性能大幅优化,人工智能在高要求基准测试中的表现持续提升


2023年,研究人员推出了新的基准测试——MMMU、GPQA和SWE-bench,以此来测试高级AI系统的极限。

仅仅一年后,性能就大幅提升:MMMU、GPQA和SWE-bench的得分分别提升了18.8个百分点、48.9个百分点和67.3个百分点。

除了基准测试之外,AI系统在生成高质量视频方面也取得了长足的进步,在某些情况下,AI智能体甚至在时间有限的编程任务中超越了人类。


美国在生产顶级人工智能模型方面仍然处于领先地位,但中国正在缩小性能差距

2024年,美国机构推出了40个值得关注的人工智能模型,远超中国的15个和欧洲的3个。

尽管美国在数量上保持领先,但中国模型的质量差距已迅速缩小:在MMLU和HumanEval等主要基准测试中,中国和美国的性能差距已从2023年的两位数缩小到2024年的接近持平。

与此同时,模型开发日益全球化,中东、拉丁美洲和东南亚等地区涌现出许多引人注目的模型。

推理成本暴降280倍、开闭源差距缩小,人工智能变得更加经济实惠且易于获取


2024年,人工智能在技术提升和成本降低方面,也取得了重大突破。

受小型模型能力增强的推动,GPT-3.5级别系统的推理成本在2022年11月至2024年10月期间大幅下降了280多倍。

硬件层面同样表现出色,成本每年下降30%,能效每年提升40%。

值得一提的是,开源型与闭源型模型的性能差距也在一年内从 8% 缩小到 1.7%。

这意味着人工智能变得更加经济实惠且易于获取,更多人工智能高科技产品走进了寻常百姓家。


复杂推理仍然是未解难题


报告显示,尽管人工智能取得了诸多进展,但在复杂推理方面仍面临挑战。

虽然它在国际数学奥林匹克等任务中表现出色,可在像PlanBench这样的复杂推理基准测试中却困难重重,常常无法可靠地解决逻辑任务。这限制了它们在精度至关重要的高风险环境中的有效性。


企业全面投入人工智能,推动创纪录的投资和使用


2024年,美国私人人工智能投资高达1091亿美元,是中国的12倍、英国的24倍。

生成式人工智能更是备受青睐,吸引了339亿美元的全球私人投资,比2023年增长了 18.7%。

越来越多的企业开始应用人工智能,2024年有78%的组织报告使用了人工智能,而前一年这一比例仅为 55%。


90%知名的AI模型均来自企业,全球科技巨头竞争白热化


2024年,近90%的重要模型源自企业,学术界则保持基础研究优势。

值得注意的是,头部模型性能差距显著缩小,榜首与第十名得分差已从11.9%降至5.4%,前二名的差距更是仅有0.7%。可以看出,各大科技巨头在AI领域的竞争已进入白热化阶段。


02 人工智能与社会生活:深度融入日常,中国人对人工智能最为乐观


人工智能日益融入日常生活


报告显示,从医疗保健到交通运输,人工智能正迅速从实验室走向日常生活。

2023年,美国食品药品监督管理局(FDA)批准了223种支持人工智能的医疗设备,而2015年仅有6种。

在交通方面,自动驾驶汽车不再是遥不可及的概念,Waymo每周能提供超过15万次自动驾驶服务,百度的Apollo Go自动驾驶出租车也在中国多个城市运营,让出行变得更加便捷和智能。


人工智能教育在不同国家之间仍然存在差距


在教育领域,人工智能和计算机科学教育不断推广,目前三分之二的国家提供或计划提供K - 12计算机科学教育,是2019年的两倍,非洲和拉丁美洲的进步尤为突出。

然而,在获取教育资源方面仍存在差距,一些非洲国家由于基础设施问题,难以充分开展相关教育。在美国,虽然81%的K - 12计算机科学教师认为人工智能应纳入基础课程,但只有不到一半的教师觉得自己有能力教授这门课程。


全球对人工智能的乐观情绪上升,但地区差距依然严重,中国对人工智能最乐观

全球对人工智能的态度呈现出复杂的态势,不同地区之间存在明显分歧。

在中国、印度尼西亚和泰国等国家,绝大多数人认为人工智能产品和服务利大于弊,三者的比例分别是83%、80%和77%。其中,中国是对人工智能态度最为乐观的国家。

而在加拿大(40%)、美国(39%)和荷兰(36%)等地,乐观程度则低得多。

不过,近年来一些原本持怀疑态度的国家,乐观情绪有所上升,如德国(+10%)、法国(+10%)、加拿大(+8%)、英国(+8%)和美国(+4%),这表明人们对人工智能的认识在逐渐改变。


人工智能在科学领域备受认可


2024年,人工智能在科学领域的贡献也得到了高度认可,两项诺贝尔奖分别表彰了深度学习(物理学)及其在蛋白质折叠中的应用(化学)的工作,而图灵奖则表彰了强化学习的突破性贡献。


03 人工智能治理


人工智能生态系统发展不平衡

随着人工智能的广泛应用,相关社会事件急剧增加。

根据追踪人工智能危害的指数——人工智能事件数据库 (AI Incidents Database),2024 年与人工智能相关的事件数量上升至233起,创历史新高,较2023年增长56.4%。报告的事件包括深度伪造的私密照片、聊天机器人与青少年自杀关联等令人担忧的案例。

然而,在主要的工业模型开发者中,标准化的负责任人工智能(RAI)评估仍然很少见。

不过,像HELM Safety、AIR - Bench和FACTS等新基准测试的出现,为评估人工智能的事实性和安全性提供了新的有效工具。


各国政府正在加大对人工智能的监管和投资力度


各国政府对人工智能治理的重视程度日益提高,全球合作不断加强。

2024年,美国联邦机构出台了59项与人工智能相关的法规,数量是2023年的两倍多,发布的机构数量也是2023年的两倍。

在全球范围内,自2023年以来,75个国家的立法中对人工智能的提及增长了21.3%,是2016年的九倍。

除了日益增长的关注度外,各国政府也在大规模投资:加拿大承诺投资24亿美元,中国启动了475亿美元的半导体基金,法国承诺投资1090亿欧元,印度承诺投资12.5亿美元,沙特阿拉伯的“超越计划”(Project Transcendence)是一项1000亿美元的计划。


对比2023年和2024年的人工智能指数报告,可以发现一些明显的共性和趋势。

在模型研发方面,中美顶级模型性能差距持续缩小,从2023年的较大差距缩至 2024 年的0.3%,中国在模型质量提升上的努力有目共睹。

大模型的性能也逐渐趋同,TOP1 和 TOP10 模型的差距从2024年的12%锐减至5%,这意味着行业竞争愈发激烈,各模型之间的技术水平越来越接近。

另一明显的变化是,人工智能的门槛不断降低,推理成本持续下降,硬件成本降低、能效提升,开闭源模型差距缩小,都使得人工智能更加普及。

同时,小模型的表现越来越出色,越小的模型效果越好。

2022年,在大规模多任务语言理解 (MMLU)基准测试中得分超过60%的最小模型是 PaLM,其参数数量为5400亿。到2024年,微软的Phi-3-mini仅用38亿个参数就达到了同样的阈值。这意味着在两年多的时间里,参数数量减少了142倍。

然而,人工智能发展过程中的问题也不容忽视。AI滥用事件呈激增态势,2024年相关危害事件数量创历史新高。这表明在人工智能快速发展的同时,安全和伦理问题亟待解决,需要建立更加完善的监管机制和道德准则。