观点 · 大模型与超级智能· 第 4 / 5 页

3.1 未来AGI之路在哪里?

这可能是所有做大模型研究的学者不断思考的事情。笔者有幸在大模型“热”起来之前和学术界、产业界的研究者一起组织了多次CCF启智会,现在回顾,确实在过去几年诞生了若干精妙的思想和技术。同时也要看到,在美国,OpenAI、Google DeepMind、Anthropic、Meta、xAI、斯坦福等公司和科研机构基本上形成了国际顶尖的大模型团队,这源于它们对创新型顶尖人才的汇聚,以及对基于大模型的AGI之路的执着和技术积累。OpenAI曾经在看不到前景和没有明显效果的阶段(2018~2021年),仍然坚定地投入大量人力和算力,这种长期的坚持和纯粹的创新精神是成功的必要条件。

AGI是否能够通过大模型的缩放定律(Scaling Laws)来实现?缩放定律描述了大模型性能与其参数量、数据规模、计算量之间的关系。虽然备受质疑,但直到今天,可能高质量的缩放仍然是提高大模型性能的重要方法。一方面,这几个因素相互关联,参数量更大的语言模型需要更多的高质量数据和训练量,以兼顾文本理解和生成任务上的规模扩展效果。另一方面,多模态超大规模预训练模型的兴起,要求模型算法具备在多模态数据(如图片、视频)输入输出条件下的规模扩展。这就要求在模型架构、训练算法、人类意图对齐等方法上不断创新。

此外,从理论的角度,AGI也需要参考人脑智能的实现机理。基于大模型的AGI或者说机器智能不一定要和人脑认知的机理一样,但剖析人脑的工作机理也许可以更好地启发AGI的实现。人脑是一个复杂系统,枕叶中视觉脑区负责视觉理解、韦尼克区负责听觉语言理解、顶下小叶角回负责视觉语言理解;海马区、蛋白质磷酸修饰、长时程增强、新蛋白产生分别负责学习和短期/中期/长期记忆的形成;前额叶则负责工作记忆、规划、规则学习和推理等复杂任务。各脑区相互配合完成人的复杂认知功能。这些分析将有助于AGI的研究。

3.2 新型原生多模态基座模型

在大模型基座方面,目前的大模型主要基于Transformer架构,有三种主流架构:编码器(encoder-only,例如BERT)、编码器-解码器(encoder-decoder,例如T5),以及解码器(decoder-only,例如GPT)。这几个架构都是国外设计并流行起来的,OpenAI把解码器发挥到了极致,Meta则将其开源引发全球技术跟随。国内在原始创新和自主研发方面严重欠缺。清华大学和智谱AI结合了BERT和GPT的优势,设计了GLM架构。但如何从本质上改进预训练模型的基座能力,实现Transformer架构上的颠覆式创新还存在巨大挑战。

另外,以GPT-4为代表的一系列语言模型基于互联网上海量的文本语料进行预训练,在语义理解、指令遵循等方面展现出了惊人的能力。然而,这些语言模型只能以文本形式处理内容,并无法处理图片等其他模态的信息。形如GPT-4V等视觉文本多模态模型通过一个视觉编码器(Vision Encoder)和语言模型建立连接,使得模型初步具备一定的图片理解能力,但这种文本视觉的交互仍然处于浅层。如何利用好互联网上海量的多模态语料(图片、音频、视频)进行大规模训练仍然具有挑战。原生多模态基座模型(Multimodal Foundation Models)通过在同一预训练过程中整合来自不同模态的数据,能从多个维度建模世界知识,不同模态的信息相互帮助,从而大大提升模型的理解能力,为下游应用打开了更广泛的想象空间。

3.3 超级对齐

OpenAI的研究者声称已经掌握实现通用人工智能的关键技术。GPT-5.0很可能会解决目前ChatGPT中存在的事实性以及复杂推理方面的缺陷;也可能会采用更高效的算法和更先进的计算架构,实现更大的模型容量和更强的泛化能力(如自动实现对低资源语言的支持,以更好地满足非英语用户的需求),具有更快的计算速度和更大的模型容量。未来实现超级智能的大模型将在人类面对的考试、工作、生活等若干方面超越人类智能,甚至在未来的知识创新方面达到或超过人类水平,实现超级智能。

超级智能将是人类发明的最具影响力的技术,并可能帮助我们解决世界上许多重要的问题。但是超级智能的巨大力量也可能产生一些危害。因此,模型学习的时候需要过滤掉包含极端观点、误导性信息和令人反感的内容的文本,让模型纠正不合适的输出,更好地了解人类的价值观、期望、意识形态和政治立场。虽然超级智能现在看似还很遥远,但OpenAI于2023年7月发布了超级对齐计划,认为超级智能可能在未来十年到来。为了管理可能的风险,我们将需要新形式的治理机构,并解决超级智能对齐问题。比如:我们如何确保比人类聪明得多的AI系统遵循人类意图?目前,对于可能具有超级智能的AI,我们尚无解决方案来指导或控制它,以防止它变得不可控。目前用于对齐AI的技术,依赖于人类监督AI的能力,但当前的AI对齐技术无法扩展到超级智能,需要全新的、颠覆式的科学和技术突破。一个可能的方法是建立一个与人类水平相当的自动对齐系统,让AI能够自己判断自己的行为和输出。这不仅需要设计全新的算法实现可扩展训练、自动模型结果验证、自动对超级对齐结果进行评估,同时还需要超大规模的算力迭代实现超级智能对齐。

3.4 大模型操作系统

随着大规模语言模型的兴起,基于语言模型的智能体系统逐渐崭露头角。形如AutoGPT、BabyAGI等系统能够以语言模型为中枢,对任务进行规划(Planning),管理任务求解过程中的上下文(Memory),并配备相应的工具插件(Tool use),从而完成复杂的任务。然而,一方面受限于语言模型的基础能力,另一方面对复杂任务的规划和记忆管理还处在初级阶段,这类系统往往只能解决一些简单任务。如何构建一个通用的,针对复杂任务的Agent框架,使其具备规划、记忆、工具使用等能力,同时能像人类一样与真实环境动态交互,从行动中“反思”(Reflection)和进步,是进一步提升当前人工智能水平的必经之路。基于基础大模型在数字与物理世界中探索和积累的经验,我们可以设计和开发出真正意义的通用大模型智能体系统(General Agent OS)。

相关资料

更多