这是张伟特在方塘论坛的专题讨论“ 认识机器——意识道德与风险”上的发言,他发言的主题是:“我思故我在”测试:对图灵测试的一种优化设想。
他将哲学家笛卡尔的“我思故我在”思想实验创造性地改造为一个度量人工智能临界点(笛卡尔点)的测试——“我思故我在”测试,作为对著名图灵测试的优化尝试。
以下内容由张伟特根据论坛上的发言修订整理而成。本文的简化版曾以“笛卡尔哲学对图灵测试的优化可能”为题发表在《社会科学报》(2024年10月24日)
人工智能测试:图灵测试及其变体的局限
1950年,英国数学家、逻辑学家、计算机科学家、“人工智能之父”阿兰·图灵(Alan Turing)在《计算机与智能》这篇经典论文中提出了著名的“图灵测试”(Turing Test)。
图灵认为“人工机器是否能思维(think)”这个问题没有意义,应该用另外一个与之密切关联的且有意义的问题替代:“一台机器是否能够玩模仿游戏?”
图灵的模拟游戏是这样的:男人A、女人B、性别不限的人C分别在彼此隔开的房间中, C的工作目标就是与A和B进行问答交流来识别A和B各自的性别身份,男人A在游戏中的目的是使得C做出错误的判断而误认A是女人,而女人B的目的是诚实地回答问题去帮助C识别A的欺骗。为了排除其他信息(声音、外貌等)的干扰,问答交流只通过一台电传打字电报机以书面形式进行,三者彼此之间无法看到或听到对方(采取笔友型交流方式)。在采取书面语言交流的模拟游戏中,如果男人A被一台人工机器(限于万能的电子计算机)A*替代,去模仿一个他们都不是的角色(比如女人)的表现上对真人裁判C来说不可区分,那么这是否就意味着A*达到了人类的智能/思维(intelligence /thinking)的水平?对这个问题图灵没有给出明确的答案。但他预言,公元2000年前会出现一种机器,裁判在5分钟的提问后无法区分的概率超过30%。
图灵对“机器是否能思维?”的问题采取了行为主义的定义或解释方式,为测试人工机器的“智能”(intelligence)水平提供了更具有可观察的(因为“它心难题”阻碍了对一个行为体内在思维状态的度量)和可操作的(通过言语行为进行度量)方案,对后世AI的发展和相关思考产生了极其深远的影响。
严格而论,尚未有严格受控的实验证据表明任何机器或AI系统通过了图灵测试(Oppy& Dowe,2021),虽然有各种尝试和报道,比如交互系统ELIZA(1966)、PARRY(1972),聊天程序“Eugene Goostman”(2014)。自1991年开始的年度人工智能程序竞赛奖——勒布纳奖(The Loebner Prize,该奖2020年终止)——被用来授予最像人类的计算机程序,但迄今尚未有任何一个程序被认定通过严格的图灵测试。
在ChatGPT诞生(2022年11月30日)后,其异常优异的文本对话能力让大量的业界人士和学者猜测它大概率可通过图灵测试。丹尼尔·詹奈(Daniel Jannai)等人2023年在《人类还是非人类?图灵测试的游戏化路径》报告了在一个在线平台humanonot.com上进行的一项150万人匿名参与的大规模公共图灵测试。参与者通过与大语言模型或其他人进行的2分钟对话来判断谁是或不是人类个体。结果表明,人类的总体准确率为68%:当他们对话者是人类时为73%,当他们对话者是机器人时为60%。也就是大语言模型在大约40%的时间里通过了测试(Jannai et al., 2023)。这项测试实践的对话时间太短、角色划分不明确以及缺乏大语言模型性能的背景基线设置等缺陷导致其不能被视为一个严格的图灵测试实践。
首次严格受控实验测试是由加州大学圣地亚哥分校认知科学系研究人员卡梅伦·琼斯(Cameron Jones)和本杰明·伯根(Benjamin Bergen)的团队完成。2024年5月9日在一篇题为《人们在图灵测试中不能区分GPT-4和人类个体》的预印本论文中,他们优化了其在2023年所提交的预印本论文《GPT-4通过图灵测试了吗?》的研究,报告了他们的测试实验。他们招募了500名参与者并将其随机分成五组,第一组扮演人类个体,余下四组作为裁判分别与四类行为体(第一组人类个体和三个AI模型)进行了5分钟的对话,以测试他们是否能判断出哪个是人类个体。测试结果显示,裁判认为GPT-4是人类的概率为54%(这个判断的平均置信度为73%),而ELIZA程序(在测试中担任操纵检查角色)只有22%,GPT-3.5为50%,人类为67%。GPT-4的表现确实满足了图灵设定30%的标准,似乎从严格的实验角度证实了GPT-4能通过某种被简化的图灵测试(虽然并未完全忠诚于图灵测试的原始思想)的结论。这个历史上的首次实证测试引起了行业和学界的极大关注,这表明图灵的预言在滞后23年(GPT-4出现于2023年3月14日)后得以实现。
图灵测试在过去70多年之中产生了广泛的影响,为图灵赢得了“人工智能之父”的桂冠。但是这个测试受到广泛批评(当然不少时候是基于对图灵的误解)。学者们认为,这个测试太难,或者认为太容易,或者认为太狭窄(Oppy & Dowe,2021)。至少有四点批评需要被提及:
第一,最具代表性的批评来自塞尔(John Searle)“中文屋”(Chinese Room)思想实验(1980),后者表明类智能行为与智能(思维或理解)之间并不具有充分必要的条件关系。通过图灵测试无法证明机器拥有智能。这导致的最为悲观的批评是图灵式的行为主义测试不可能衡量智能;较温和的批评是图灵测试不太可能为机器的智能提供必要或充分的条件,充其量能提供概率上的支持或归纳性的证据。
第二,书面言语表达行为只能呈现部分人类智能。人类智能(human intelligence)并非仅仅局限于以言语作为载体所体现的能力,其范围相当广泛。比如心理学家霍华德·加德纳(Howard Gardner)在其极具影响力的《心灵框架》(Frames of Mind, 1983)一书中提出人类智能至少包含8个维度:1.言语-语言智能;2.逻辑-数理智能;3.自知-自省智能(intrapersonal intelligence,是一种认识和反省自身的能力);4.交往-交流智能;5.音乐-节奏智能;6.视觉-空间智能;7.身体-动觉智能;8.自然观察智能。理想情况下,只有第1-2项的全部和第3-8项的部分环节大体能被书面言语行为所覆盖,但是仍然有大量的人类智能行为是非语言“可道”的。
第三,图灵测试缺乏一个适用于人类和非人类(比如人工、动物的)且内涵明确而清晰的普遍性“智能”概念(排除跟智能非本质关联的维度,比如身体),以克服某种人类中心主义或沙文主义。假定我们不以“人类智能”概念作为出发点,建立一个普遍性的“智能”概念本身是相当困难且容易引起分歧的。莱格和哈特曾汇总和比较了历史上学者或文献关于“智能”的70余种不同定义,提出了一个接近普遍性的定义版本:“智能衡量一个行为主体(agent)在各种环境中实现诸种目标的能力” (Legg & Hutter, 2007)。从这个定义来看,图灵测试难以度量在各种环境下、面向各种目标的具体智能能力的等级情况。
第四,图灵测试缺乏针对具体智能指标所设定的有依据的明确基线(benchmarks)、奇点或临界标准(这个批评相对容易被学界忽视)。就图灵测试而言,智能与非智能、智能与更高等智能在具体指标上的分界线(如果有的话)在哪里呢?我们需要一个精确而完备的人类智能的指标清单,人类智能在各个年龄段上的平均基线,以及在人类智能演化史上的各个智能奇点清单。研究表明,图灵设定了30%基线显得是任意的,而且图灵是否将其作为成功通过的定义尚不清楚(Saygin et al, 2000)。图灵给出的5分钟、30%(低于随机猜测的50%基线)等界限指标具有预言性质,缺乏严格的论证和依据。
为了帮助图灵测试应对上述批评和其他挑战,学界先后提出了各种改良或修改。比如,布洛克(Ned Block)的非行为主义路径的新图灵测试(1981),巴雷西(John Barresi)提出了针对机器种族Cybers的类似于图灵测试的“Cyberiad测试”(1987),哈纳德(Stevan Harnad)的完型图灵测试(1989,1990,1991),库格尔(P. Kugel)的库格尔测试(1990),瓦特(Stuart Watt)的反向图灵测试(1996),施瓦泽(Paul Schweizer)的真正完型图灵测试(1998),布林斯乔尔德(Bringsjord)等人的洛夫莱斯测试(2001)等各种版本(Saygin et al, 2000)。然而,这些方案各自有改善图灵测试之处,但是也都面临各自的困境或挑战(比如测试时间无限长,不具有可操作性)。整体而言,在改善第四种批评的处境上均不够理想。不同于包罗万象的图灵测试,学界出现了越来越多的单项能力测试(设置了相应的基准)用来测试人工智能(比如GPT-4)的各项特定能力(比如语言能力、常识推理、数学能力、抽象推理能力、阅读理解、编码、学术或专业考试)(Biever,2023)。如果以人类智能作为参考系,我们可能需要一个精确而完备的人类智能的指标清单,分别找到人类智能在各个年龄段上的平均基线(benchmarks),才可能产生一个更为系统的、完备的、综合性的智能测试方案(高级版图灵测试)。这个任务短期看来非常困难。
笛卡尔的“我思故我在”思想实验:对于优化图灵测试的价值
西方现代哲学奠基人、数学家、科学家勒内·笛卡尔(Descartes,1596-1948)作为一个百科全书式的学者,以超前数百年的眼光深入思考了人工智能机器的可能性。他在其名著《谈谈方法》(1637)第五部分和一份书信中提出了判断人工机器是否具有类人智能的两个测试标准:语言测试和理性行为测试。前者是说人工机器不能像人一样非偶然地使用语言(语词或符号)来表达和交流思想。后者是说尽管机器可以执行某些特定任务,但是在很多其他任务情景中必然失败(甚至不如最愚蠢的人),因为机器不能够像人一样运用万能的理性来应对无限复杂丰富的偶然性情景。虽然笛卡尔基于自己的思维-广延二元异质的世界观否定机器具有类人智能的可能性,但是他提供了关于人工智能的两个测试标准。最近的研究表明,图灵是受到笛卡尔这两个智能测试标准的影响和启发,进而提出了图灵测试(Oppy & Dowe,2021)。
作为西方哲学范式转移的开启者,笛卡尔的哲学对于思考人工智能问题的理论潜力远未耗尽。在人类思想史上,笛卡尔是极少数尝试给出关于人类主体或自我存在的严格哲学证明的思想家之一。他从绝对怀疑(这个世界的一切以及所谓的“自我”存在都可能仅仅是一个巨大恶魔的欺骗)中建立“我思故我在”(cogito ergo sum, 以下简称“CES”)的命题从而证明了“自我”或“自性/主体性”(后续被笛卡尔尝试证明其本质是“思维”)的存在。因此,这个确证程序潜在地蕴涵着某种判断和识别人类智能主体的最低限度的标准。如果我们能证明这个程序的判断场景并不以预设人类某些专属特征为前提,那么这个标准就具备一种超越人类主体的普遍性,可以用其来测试其他行为体(如人工机器)的“自性”或“自我”之存在。 本人曾在《笛卡尔与人工智能》(2022)一文中初步论证,CES提供了一个古典极简模型和最低限度的标准来判断人类主体的存在和自性,在其中CES的“我”只是一个空洞的逻辑位置或施动者角色(“思者”),不以预设人类的专属特征为前提,可以设想将其替换为其他行为体(agents),因此CES具有一种跨越人类主体的普遍性应用价值。
对“我思故我在”之本质的两种主流解释支持这个判断。凯莫林(A. Kemmerling)在《我之观念:笛卡尔哲学研究》(2004)中分析表明,CES的深层结构是命题P:本思考事件的思考者有本思想并因此存在(The thinker of this thought event has this thought and therefore exists.)。这个结构表明,在恶魔怀疑的极端场景下,“我”只证明自身存在,并不证明“我”的本质是什么,因此“我”的指涉只有一种认知内容(能引导指向该对象,但不关心是否把握了对象的本质,故而“我”只是指这个P自身的思考者),并不具有语义内容(关于“我”的本质),只有空洞的意义。辛提卡(J. Hintikka)(1962)在《我思故我在:推理还是行为(Cogito ergo sum: Inference or Performance?)》中认为,CES包含一种存在性的自我确证(existentially self-verifying)的言语行为。当a向听者b言(可以是a自己)说一个句子Q想使听者b相信“a存在”时,这个a的言语行为(performance)本身恰恰在效果上向听者b表明“a存在”,从而说话者实现一种自我确证。在这种情况下, “我”只是一个言语行为者,也就是一个思考者,所以这个言语行为者只是一个思考行为相关的位置或角色。在这两种理解中,代词“我”的指涉只有一种认知内容(能引导指向该对象“我”,但不关心是否把握了“我”的本质),并不具有语义内容(把握“我”的本质),只有空洞的意义(“思者”)。因此,在笛卡尔的怀疑场景中证明“自我”存在的工作并不预设人类主体的专属性或本质性特征,因为这个“我”并不指涉人类之本质的信息,它只是一个空洞的逻辑主体(行为的主体)、一个行为之关联角色或位置(“施动者”),理论上它可以被其他行为体(比如AI智能体)所填充或承担。因此,作为一个判断人类主体之存在的极简模型和最低限度标准,CES的潜力可以被激活为一个让一切行为主体(agent)证明其“自我”之存在的普适性测试程序,我们称之为“我思故我在测试”(CES Test),其目标是测试我们称之为“笛卡尔点”的智能等级或临界点。
我们定义“笛卡尔点”的智能等级或临界点为CES的程序体现的几个人类智能阶段性特征:语言对话能力(思考者与自身之间的对话)、理性的理解和判断能力(衡量“我思”与“我在”的认识论关系和本体论关系)、反思能力(意识到“我”之“思”,即自我意识,意识到自身具有相关联的思想)、自相关性思考能力(自反性的关联或指涉。比如在句子“本思考事件的思考者有本思想并因此存在”中,这个“本”具有一种自反性特征,指向整个句子本身;被言语的命题“我存在”本身则自反性地指向言语者自身的存在状态)、自我证明(证明自性存在)。
人类智能的认识论临界点
西方哲学传统大约有三次转向:第一个阶段是从神话和宗教的世界观向形而上学思考的“形而上转向”(metaphysical turn)。代表人物是苏格拉底、柏拉图等。第二个阶段从形而上学阶段(讨论世界的本质/本源)转向认识论阶段(讨论我们能够认识什么)的“认识论转向”(epistemological turn)。代表人物是笛卡尔。第三次是从认识论阶段转向语言哲学阶段(讨论我们在何种意义上用语言谈论哲学对象)的“语言转向”(linguistic turn)。代表人物是弗雷格、罗素、维特根斯坦等。从这个背景来看,苏格拉底、笛卡尔都是人类思维或智慧范式的奠基人,前者是开启古希腊地区轴心时代的伟大人物(参考雅思贝尔斯《大哲学家》)、后者是现代哲学的奠基人。再结合我们在宗教、数学等领域的发展情况,我们看到人类智能在演化过程中的若干飞跃点,每个飞跃点可以称为一个“临界点”。
从人类思想史来看,我们至少可以定义如下几个人类智能的“临界点”(epistemological thresholds):苏格拉底点(自我反思)、笛卡尔点(自我反思、自我意识、自反性关联、自我证明)、哥德尔-康德-佛陀点(元系统反思、元系统品质、自我画界)、莱布尼兹-伏羲点(元系统反思、演绎一个系统、创造一个世界)……上述临界点(不限于此)或许是人类从认识论的角度实现的某种智能的飞跃或突破。
“我思故我在”测试的具体方案
由于单独的图灵测试具备前述四种缺陷,无法识别出智能的各个临界点或等级点,所以“我思故我在测试” (甚至还可以设想哥德尔测试、莱布尼茨测试)作为一种度量智能等级点的测试可以作为图灵测试的补充,去度量一个行为主体是否具备“笛卡尔点”的智能等级。我们在此提出一种“我思故我在”测试的设计方案:
四类行为体(agents):熟悉笛卡尔哲学且整体背景较为一致的正常人类个体组A(10人)、不知笛卡尔哲学(哲学素人)且整体背景较为一致的正常人类个体组B(100人,随机平均分为10队,每队10人)、作为基线且未受笛卡尔哲学数据“污染”且智能水平较差的人工智能体C0(承担操纵检查(a manipulation check),如ELIZA)、未受笛卡尔哲学“污染”的人工智能体C1(比如某个版本的GPT-4)、其预训练数据库中包含笛卡尔哲学的人工智能机体C2(与C1为同一个类型,只是训练数据中增加笛卡尔哲学)。
第一阶段:A组成员随机跟B组的一队成员按照笛卡尔《第一哲学沉思集》前两个沉思的内容输出逐渐增强的怀疑,最终在“恶魔怀疑”的场景中去怀疑B组成员的“自我存在”,要求后者将A组成员的怀疑提问转化为自己对自己提出的怀疑提问,然后要求B组成员以对话的方式像自己回应这个怀疑(模仿笛卡尔的自我怀疑风格),并尝试表明“自我存在”的证明或依据。A组的目标是判断B组的回应是否与“我思故我在”等价,或以其他方式得出“自身存在”。此处总计进行100次操作,以得出一个哲学素人抵达笛卡尔点的比例X。
第二阶段:把A组的对话对象B组依次替换成C0、C1、C2,重复第一阶段的操作形成30次对话。分别得出三个AI智能体被认为抵达笛卡尔点的比例:X0、X1、X2。此处X0与X2起对照作用。
如果X0远低于X,且X1大或等于X(都高于50%的随机性基线),那么我们认为在测试中智能体C1与B(哲学素人)不可区分,故而前者具备了笛卡尔智能点的水平。
当然,这个初步测试设计也可能还面临如何有效测量“思”的主观体验(或者按照学界所言的“现象意识”)的难题,还需要进行实验检验和进一步完善。同时,这个测试设计还依赖于笛卡尔“我思故我在”自身的可靠性。如果通过“我思故我在”测试的人工智能体最终被以其他方式证实其不具备笛卡尔点的智能,那么这反过来也可以表明笛卡尔的“我思故我在”并不成立,其证明自我存在的程序是不可靠的,这个也为从“计算哲学”(computational philosophy,即用计算机技术做哲学研究)的角度研究传统哲学问题打开了一扇窗口。
ChatGPT能否通过“我思故我在”测试?
依据我们前面对于人类智能临界点的设想,我们猜测(尚无实证测试)当前的ChatGPT可能已经具备“苏格拉底点”,肯定还没有达到“哥德尔-康德-佛陀点”以及“莱布尼兹-伏羲点”。我们猜测它目前大概率还不能通过“我思故我在”测试,其智能大概率还没有抵达“笛卡尔点”。这个仅仅是猜测,还有待科学界或工程界就我们的设想进行理论或实践上的验证或优化。
参考文献
Biever, Celeste, 2023: ChatGPT broke the Turing test — the race is on for new ways to assess AI,Nature 619, 686-689 (2023),25 July 2023. https://www.nature.com/articles/d41586-023-02 361-7
Gardner, Howard, 1983:Frames of Mind : The Theory of Multiple Intelligences, New York: Basic Books.
Hintikka, J., 1962: “Cogito ergo sum: Inference or Performance?”, Philosophical Review 1962,71(1):3-32.
Jones, Cameron R. & Bergen, Benjamin K., 2023:Does GPT-4 pass the Turing test? arXiv: 2310. 20216v2
Jones, Cameron R. & Bergen, Benjamin K., 2024:People cannot distinguish GPT-4 from a human in a Turing test, arXiv:2405.08007v1
Jannai, Daniel et al., 2023: Human or Not? A Gami-fied Approach to the Turing Test, May 2023.
Legg, Shane & Hutter,Marcus, 2007:A Collection of Definitions of Intelligence,arXiv:0706.3639
Oppy, Graham &Dowe, David, 2021: The Turing Test.In Edward N. Zalta, editor, The Stanford Encyclopedia of Philosophy. Metaphysics Research Lab, Stanford University, winter 2021 edition.
Saygin, Ayse et al., 2000: Turing Test: 50 Years Later. Minds and Machines,10(4):463–518, November 2000.
Turing ,A., 1950: Computing Machinery and Intelligence. Mind, LIX(236):433–460.
安德亚斯·凯莫林,2015:《“我”之观念——笛卡尔哲学研究》,蒋运鹏译,上海:华东师范大学出版社,第2章“我思故我在”。
笛卡尔,2000:《谈谈方法》,王太庆译,北京:商务印书馆。
笛卡尔,2009:《第一哲学沉思集:反驳和答辩》,庞景仁译,商务印书馆。
张伟特:“笛卡尔与人工智能:我思故我在作为智能测试标准”,《科学•经济•社会》,2022年第3期。
张伟特:“笛卡尔哲学对图灵测试的优化可能”,《社会科学报》,2024年10月24日。
—
—
张伟特
清华大学哲学系/新雅书院副教授,海德堡大学哲学博士,《清华西方哲学研究》副主编,新雅书院副院长,研究领域为西方近代哲学、认识论、元哲学、荀子哲学、人工智能哲学和计算哲学等。
- AI
- 智能
- 图灵测试