AI之道

黄铁军在方塘论坛上关于人工智能基础理论与前沿实践的主题演讲。

作者
黄铁军
约 11 分钟
人工智能与人文思想对话研究主题图

      在6月22日的2026方塘论坛开幕式上,黄铁军老师进行了题为“AI之道”的主题演讲。

      黄铁军是北京智源人工智能研究院理事长、北京大学计算机学院教授。他在人工智能基础理论与前沿实践方面具有深远影响,长期致力于视觉信息处理和类脑智能研究,发明了脉冲连续摄影原理和超高速视觉芯片、相机与系统,曾获多项国家技术发明奖和国家科技进步奖。

      他在演讲中不仅梳理了他关于AI技术发展的看法,也讨论了人与技术的关系。以下是他演讲的主要内容。

特别感谢方塘研究院给我这样的机会。本场演讲题为《AI之道》。会议组织者问我英文是翻译成“The DAO of AI”还是“The Way of AI”,我说是后者,即AI的技术路线。当然“小道”和诸位哲学家研究的“大道”也是密不可分的。

二十多年前我学开车,就在琢磨:“道”听起来十分高远,但它与开车之间却有天然的联系——也许“道”最初就来自道路、来自驾御:车不能随便开,不能开到田里,只能开在路上;其次要遵守交通规则;除了交通规则之外,还要凭感觉及时判断,才能更安全。

我对“道”未有深研,但以驾车作类比,今天所讲AI之“道”,与之颇有相通之处——讲的是做AI时技术路线是怎样的、心里怎么想的,还未上升到哲学的程度。

作为AI从业者,与许多同行一样,技术路线经过了多次转换、改变,乃至反思和颠覆。为什么会这样?因为AI还没有“大道”,只存在“小道”。既然只有“小道”,就不知道哪条路线一定是对的,只能不断摸索,曲折前行。下面挑几个例子。

1956年夏,由洛克菲勒基金会资助召开的人工智能达特茅斯研讨会上,四位发起人在申请书中提出:要把包括学习在内的智能精确描述出来,并在计算机上执行。这一思路走了三十多年,证明并不能解决问题。

三十年后,这一困境被抽象为一个哲学问题——约翰·塞尔提出的“中文屋”思想实验。计算机可以进行高速的符号处理,最终表现出一定的智能现象,但这种智能是假的,只是高速、大存储和统计的结果,计算机并不真“懂”中文,对中文词语的含义一无所知。

归根到底,这是人工智能上半叶的核心困境:计算机、人工智能只是在处理符号;符号背后的意义它没有,的确只是一个高速处理过程。

但符号对人来说是有意义的——随便说一个词、一句话,都包含丰富的含义,远非辞典那段解释所能概括。因此,计算机本身并未真正表达语义,它只是符号的汇总处理。当然,这是人工智能上半叶的问题,今天的人工智能已经在相当程度上解决了这一问题。

还有一个现在的热词——AGI。很多创业公司上来就讲要做AGI。AGI这个词最早出现于1997年。需要强调的是,AGI通常被理解为“全面超越人类智能的系统”——人能做的它都具备。但稍作思考,便会发现AGI水太深了。

人具备的东西太多了,比如自我意识——如果AI没有自我意识,它能叫AGI吗?这么重要的特征不能缺席。所以,严格而言,AGI一定是具备自我意识的,而且是超过人类的某种意识形态,当然未必等同于人类的意识。

本场演讲所说的AGI即此涵义——“具备自我意识的、全面超越人类的智能体”。

AGI何时出现?业界有诸多讨论。2015年1月2日至5日,美国的生命未来研究所举办了一场活动。这个研究所最早由马斯克捐资支持,由麻省理工学院物理学教授Max Tegmark牵头。这个研究所组织了许多会议讨论人类未来重大问题,其中最有影响的就是两年一次的关于AGI的讨论。

2015年的会议,邀请了大量AI学者、未来学家与哲学家,请所有与会者就“真正的AGI何时出现”扫码作答——你认为哪一年,就输入那一年。对结果排序后,中位数为2045年,即半数受访者认为AGI将在2045年之前实现,另一半受访者认为将在2045年之后实现。一半人认为三十年内即可实现,这已经特别紧迫了,因此后续他们围绕这一问题办了多次会议。

2015年1月7日,我发表过一篇文章,写于2014年。《中华读书报》编辑向我约稿,那篇文章的题目原为《制造超级大脑》——当时我担任北京大学计算机系主任,文章尝试回答何时能造出一台比人脑更强大的电脑。

题目本身相当中性,但仍显激进,因此发表时编辑改为《人类能制造出超级大脑吗?》。这篇文章探讨的正是实现AGI的可能路线。我认为沿这条路走下去,大致在三十年左右的尺度内,这件事是会发生的。为什么?

这篇文章的核心思想——也是我今天想讲的——是:在意识的发生机制最终获得科学解释之前,能够制造出具有自我意识的人造大脑吗?回答是肯定的,而且制造出这样的装置,可能正是回答这个问题最便捷的途径。 

我从1992年读研究生开始,总觉得要先把智能、意识背后的科学原理搞清楚,总想找到那个抽象的原理,这也是很多人的惯常思维定式。但2014年开始,我觉得这条路走不通,在我有生之年这个原理可能就找不到,于是不再去找。不找怎么做?依然能做!即便三十年后仍搞不明白那个原理,也能造出一个具备超人功能的超级大脑——这就是该文的基本思想。

为什么会有这一认知转变?因为我们太被“科学原理”和“大道”所迷惑了。事实上,在人类科技史上,推动历史进步的主要力量是技术,是不断试错的进程——并非有人先把原理搞明白,然后再发明出实际系统。技术驱动是主线,“先把原理搞清楚再启动”的设想不现实。

我也读过一些科技史,发现绝大多数情况确实是技术实现在先,原理与科学总结在后。但教科书并不这么写——教科书先讲基本原理,再讲技术实现,最后讲工程优化,因此把我们培养成“先弄清原理再动手”的思维方式。真实历程恰好相反。

所以真要做原始创新,就得从摸索、从看不清楚、从试错中前行。至于将来能否总结出原理、何时总结出来,不影响我们的探索。

当然,我们也不能盲目尝试,仍需有思路、有可能的方案。今天没有智能原理,三十年后乃至三百年后也未必能解决智能的科学原理问题,但我们可以先造出来——这就是我所认为的“AI之道”。

我的“AI之道”可以概括为两句话:“结构决定功能,功能塑造结构。” 这两句话来自生命科学。我们有什么样的DNA,就会有什么样的身体和大脑,也就有什么样的功能与智能,这是决定性的,就是结构决定功能。

当然,后天还会进一步塑造我们的智能,但就人类智能而言,结构是基础——结构,无论是DNA、身体,还是神经系统。

结构从哪里来?从简单到复杂演化而来。怎样演化?生物体要在所在环境中接受塑造、适应环境,这就是功能塑造结构。若放大到出生之前,便是物竞天择的进化过程。

在此过程中,DNA、身体、大脑都是进化的产物,只是其先天演化比后天学习要慢得多。结构的决定性与塑造同步发生:结构决定生物体的功能,同时在演化与不断被塑造。

这张图总结了我们团队自2018年成立以来开展的各类AI项目。名称纷繁,但基本思想就是上述两方面:设计什么样的结构、用什么方法去训练它——结构决定功能,功能塑造结构。

举两个例子。人工神经网络与真正的神经网络相差甚远,但无论如何也是神经网络——由大量神经元相互连接而成。只要存在网络,便可用数据训练。至于训出来的功能好坏,事先无法得知,但至少可以动手去尝试。这一思路已经尝试了80年,从1943年开始,训练神经网络就是人工智能最主要的路线之一。

在这一过程中有大量失败与探索。人工神经网络的成功,是从千千万万次尝试中筛选出来的。其中一是神经网络本身的进展,例如深度学习和Transformer,另一成功案例便是今天大模型的训练方式——“预测下一个token”。

这一贡献获得了2018年图灵奖。八十年代的计算机只知道处理符号、处理词,并不知道词背后的含义,此次工作解决了这一问题——词的含义可以用一串数字表示,即每个词用一个向量表示。

一个词的含义怎么可能用一串数字表示?这正是其创新之处。可以这样直观理解:我们脑中关于每个概念、每个词的表示,最终一定体现在某些神经突触的连接强度上——比如用一万个突触表示一个概念。

脑中关于某事的认知,最终都会表现为大脑中某些神经突触连接强度的组合,因此都可转化为一串数字。这条技术路线是否有效尚需验证,但这个思路是有依据的。

第二,怎样训练神经网络?做自然语言处理时,不必再人工标注,可直接用一串文字中的前n−1个去预测第n个。这一序列最关键的就是前面这前n−1个token和后一个token之间存在语义关系。这样就有了“智能”——正如说话,如果是随机蹦字,大家会认为没有智能;如果输出流畅自然,大家就会认为有智能。

如果神经网络能做到,便具备人工智能。给定n−1个高维向量,预测第n个,是可以实现的——将其交给一个神经网络,持续不断地训练,不断修改参数迫使输出逼近第n个词对应的向量,最终训练出的参数就与人脑参数有类似之处,映射了语言背后的规律,或者说智能与知识。

当然,虽然方法2000年Bengio就提出来了,但当时神经网络并不够好,所训出的智能远未达到惊艳的程度,直至2017年Transformer的出现。Transformer的关键就是要精确计算 token 之间的关系:一句话中的某个词与下一句话中的某个词之间存在影响,影响的程度需要精确计算。

语义本身就来自关系——这是语言学的一个基本观点。每个词的含义来自哪里?来自关系。

例如“红”,每种语言都有关于“红”的符号,例如英语的red,关键不在“红”还是red,而是这一符号与其他符号的相互关联。关系决定了它的意义,而非它本身就具有“本质意义”——它本身只是一个标签。

马克思说,“人是一切社会关系的总和”——作为社会人,我们通过社会关系来理解一个人。符号更是如此。

所谓ChatGPT、所谓大模型,其核心就是三点:每个词用一个向量表示,用前面的向量预测下一个token,神经网络用Transformer——这就是ChatGPT,也是今天大模型的核心思想。

把上述要素组合在一起,就是OpenAI做的事。表现是智能是神经网络涌现出来了,何时涌现?究竟拥有何种智能?事先无人知晓。

这类似我们的大脑学得多了,就会产生新的想法。这是一种自然现象,确确实实发生了——这就是今天人工智能让人感受深刻的原因。

它真的存在了。我们不知道“为什么”,但我们知道“怎么做到的”。围绕人工智能存在许多批评,但这就是科技发展的一个历史阶段,许多技术突破的第一阶段都是如此。

把这一方法继续推进会怎样?推广到其他数据可不可行?2022至2025年,智源做的一件事表明:是可以的。我们构建了一个多模态智能体,今年2月在《自然》发表了论文,它有可能正是通往未来的一条道路。

不熟悉的数据怎么样?“脑”信号对普通人如同天书,用同样路线也能学得很好,这就是智源最近发布的脑模型,能够像医生看到一张核磁共振影像或脑电信号便能判断疾病。后续仍需大量临床实验,但目前看来,已显著高于许多医生与博士生的水平。

刚才提到,语言、视觉、多模态、脑信号——世界十分复杂,而科学的目的正是试图理解世界。把这些都纳入进来可不可行?只要是能够采集到的信号,只要它对世界有某种表达,让大模型去学习——若能学成,就类似大脑。世界要复杂得多,包括机器人、具身智能;但归根到底,世界由分子、原子、基本粒子构成,世界的变化过程也不止于抓取一个物体,而是各种各样的过程。

至少在信念层面,我们认为是有可能的。当然,要采集这些数据,就需要科学与技术合力推进——需要更强大的感知与分析手段。

我们靠什么探索世界?生物靠身体,科学靠仪器。因此,被探索的不仅是一个客观世界——我们还要有一个主体来探索它。不仅要做客观的模型,也要做主观的模型,需要有一个身体。

这是我们用约一年半时间完成的一个线虫模型。2010年至2021年间也有人尝试,但未能做出来,我们把“十年”压缩到了“一年”——将线虫302个神经元的精细结构全部以模型复刻出来。

解剖数据由生命科学家完成,数字模型由我们团队完成。仅复刻结构还不够,神经元之间的连接强度才是关键。这些数字只能靠训练得到。

所以2021年之后才能做出来,因为我们掌握了训练方法——既然能训练Transformer,为什么不能训练一个生物神经网络?做法是一样的。难点在数据。为此,团队专门为它构建了液体仿真环境,包含水压等,由此采集数据,再去训练近两千个神将连接参数。

这样一来,模型就“活”了——其结构来自生命的进化,其智能则由环境数据训练得到,二者结合,表现出的觅食行为,与真实生命几乎无异。这不是动画,而是模型真实驱动身体做出的动作。

举这个例子是想说明:我们已经掌握了一套方法,沿此路径推进,线虫可以做,心脏也可以做,且已相当精细。今年我们与安贞医院合作建立了心脏AI联合研究。其他器官从原理上讲也是类似的,身体可以不断更精细地建模。

身体可以建模,世界的建模最终也可装入大模型,那么AGI便是有可能的。这将带来何种影响,是今天的重要议题之一。按一些西方学者的判断,它具有毁灭性,因为它的能力将超过人类;但我们也需要从另一面来看。

2019年前述生命未来研究所举行的会议上提出:人类智能可能存在天花板——当我们面对无法应对的风险时,需要更强的智能。人类现在有核武器,核武器固然危险,但若小行星真正撞向地球,仍需用核武器在数千公里之外将其推偏,目前我们具备这一能力。当然,也存在更复杂的情形,例如外星智慧体到来时如何应对?这可能超出人类大脑的智能,需要AGI。

一旦AGI能力超过我们,我们将无法控制它,这是必须正视的问题。

如今做具身智能、做世界模型,都需要带着探索去做。这一阶段大约还有十年——大致而言,在十年左右,性能上超越人类的具身智能体将被做出来。

到2045年前后,AI感知、认知乃至产生意识的可能性是存在的。当然,这并无严格的科学论证,仅是按照科技进步速度的估计。

我认为存在与AI形成良好对话的可能性——即便我们最终无法完全理解大脑奥秘,人与AI之间仍有理性交流的机会。我们无法与以前的机械设备交流,但与AI可以形成一种和谐共处的关系。

届时,人类或如年迈的长者,而智能体将像年轻人走向宇宙深处。我们之间仍保有沟通,犹如远行的子女偶尔来电——这种交流是存在的。我们也会因此感到欣慰:虽然我们没有走出去,他们终究走出去了。

这就是我所设想的2045年。谢谢大家。