观点 · 大模型与超级智能
手册 · 覆盖 AI,约 26 分钟。
一、大模型发展回顾
从技术层面而言,ChatGPT的优异表现主要依托超大规模预训练基座模型GPT-3/3.5/4、有监督指令微调以及基于人类反馈的强化学习。回顾大模型的发展史,大致可分为四个阶段。
1.1 算法之战(2018—2020)
2017年谷歌提出了具有自注意力机制的Transformer机器学习模型架构,该架构迅速席卷了整个人工智能研究领域,成为自然语言处理等相关研究的主要方法。20182020年先后出现了基于Transformer的BERT、GPT/GPT-2/GPT-3、T5等基于大规模无标注数据自监督学习的大规模预训练算法。这些算法模型均在大数据支持下拥有较大规模模型参数,具备较强的通用能力,可完成多场景任务,显著降低学习成本、提高学习效率。尤其是BERT在十多个自然语言理解任务上的精度大大超过传统算法,掀起了BERTology的研究范式;2019年GPT-2实现了自然流畅的文本内容生成,彼时基于GPT-2的应用Talk2Transformer让人惊艳(当然现在和ChatGPT比起来算是粗糙的了),同时也使笔者坚定了投身生成式人工智能的决心;2020年谷歌的T5将自然语言的翻译、分类、回归、摘要生成等任务都统一转成文本到文本(text-to-text)任务。可以说20182020年是大模型的算法创新年,这段时间笔者团队研发了属于我们自己的算法GLM(General Language Model)。
1.2 模型之战(2020—2022)
这个时期基于各种预训练模型框架和算法,多种模型如雨后春笋般诞生。2020年的GPT-3(拥有1750亿参数)可以看作这一战的起点,它开启了基座模型的新时代,在语言生成、上下文学习和知识(常识)理解等方面展现出惊人的能力。很多人喜欢把这一年叫做大模型元年。随后全球范围内掀起了一股大模型研究的热潮,谷歌、Meta等公司开始不断发布百亿到千亿的大型语言模型,例如Gopher(2021年)、Chinchilla(2022年)、PaLM(2022年)、Claude(2022年)。但是这些模型都不开源,因此开源大语言模型也开始受到关注,比如Meta的OPT(2022年)、LLaMA(2023年)和HuggingFace的BLOOM(2022年)。国内一直缺少原创的开源千亿基座模型,更重要的是产学研各界对大模型的发展和产业化还没有形成共识,对于应该发展大模型还是转而发展小模型,大家还没有达成统一认识。2022年,清华大学和智谱AI开源了基于GLM算法训练的千亿基座模型GLM-130B,这一工作引起了全世界的关注,包括斯坦福大学、谷歌、OpenAI、Apple、Meta都对该模型进行了深入分析和对比。2022年11月斯坦福大学发布的大模型评测报告,对全球30余个开源模型进行了深入评测,GLM-130B是亚洲唯一入选的模型,在准确性和公平性指标上与GPT-3接近或持平,鲁棒性、校准误差和无偏性优于GPT-3。这一时期,国内外在大模型的研发上可以说是百花齐放。国内如清华大学、北京智源人工智能研究院、百度、华为、阿里、智谱AI等,都竞相追赶。
1.3 产业落地之战(2023)
2022年11月30日ChatGPT发布,唤醒了所有人对大模型的认知,大模型开始广为人知。一夜之间,似乎所有人对必须发展大模型达成了共识。大模型的发展不再仅限于模型技术的发展和模型训练本身,更重要的是如何实现模型的产业化应用。大模型开始在各个领域开花结果,在金融、互联网和教育等众多行业落地。得益于GLM-130B基座模型的能力,笔者团队仅用了2个多月,在2023年2月初就研发出了第一代ChatGLM,是国内最早可以线上测试使用的千亿级对话模型;同年8月基于ChatGLM开发的智谱清言通过国家第一批《生成式人工智能服务管理暂行办法》备案认证,正式面向公众上线使用。随后,全国多个产业纷纷投身大模型:短期的做AI升级,原来用分类算法、小模型实现的开始用大模型替代;中期的开始研究自己的定制化大模型。于是各种领域大模型(例如数学大模型、化学大模型、医疗大模型等)以及基于已有算法框架训练注入不同数据训练出的各种模型纷纷推出,一时间形成了“百模大战”的情形。仅此一年,据不完全统计,全国实现大模型初步应用的企业和部门有数千个。2023年是大模型产业落地元年。
一个插曲是2023年3月14日这天(大模型里程碑日),就像事先约好了一样,OpenAI发布了效果再次遥遥领先的GPT-4模型,Anthropic发布了对标ChatGPT的Claude,谷歌推出对抗OpenAI和微软组合的PaLM API服务(Bard),我们开源了ChatGLM-6B,斯坦福大学发布Alpaca,Midjourney发布V5。其中,ChatGLM-6B三个版本的全球下载量超过1300万,在GitHub上总计星标数达到6万,超过Meta的LLaMA两个版本总和;团队也是GitHub公布的星标数超过500、大模型开源项目数最多的五个科研机构之一(前四分别是:Open AI、微软、HuggingFace、谷歌)。2023年笔者团队也有幸获HuggingFace全球最受欢迎的开源机构第五名,超过OpenAI、谷歌、微软,也是国内唯一上榜的机构。更加值得高兴和欣慰的是,我们发现开发者在这些开源模型上,开发出了700多项优秀的大模型开源项目,这也坚定了我们要围绕开发者继续研发新一代大模型、建立大模型生态的决心。2023年3月14日这一天,所有大模型的研究者、产业工程师们都在社交媒体(Twitter等)上欢呼,大模型里程碑日来了。时至今日,那天发布出来的模型都是经典中的经典。