观点 · 大模型与超级智能· 第 5 / 5 页

3.5 芯算一体大模型机

传统的大模型研究思维一直是围绕芯片进行算法设计,导致当前所有大模型的基础算法都只能在H100/A100类似体系架构上进行设计与实现。芯算一体大模型机是一种将芯片(核心硬件)与算法(软件)深度融合的下一代计算设备,目标是实现超高算力、超大存储以及优化的数据处理能力,为人工智能、大数据分析、科学计算等高性能计算提供基础支撑。大模型规模不断扩大,其对计算资源的需求也在急剧增加。传统的CPU架构在处理大规模并行计算任务时存在效率瓶颈,而GPU架构并行处理能力很强,但在制程方面被美国“卡脖子”。以华为、海光DCU为代表的国产芯片虽然在这方面取得了很大进展,但距离英伟达GPU还有一定距离,急需跨越式的软硬架构设计新思路。谷歌的张量处理单元(Tensor Processing Unit,TPU)以及其他类脑芯片在这方面也有一定创新,但仅面向谷歌内部使用。

因此,有必要从底层开始,围绕大模型/AGI算法设计研发新型芯算一体大模型机。当前国产芯片被“卡脖子”的最关键技术是单GPU芯片的计算能力和芯片间的高速通信,尤其是后者。芯算一体大模型机的核心思想是首先设计全新的大模型算法,然后针对新算法优化内存使用,提升芯片计算效率和芯片间的通信效率,设计全新的芯算一体大模型机有望在多种模型研究上得到广泛应用,用于开发和训练更复杂的AI大模型,如多模态、智能体、自反思大模型。通过设计全新的大模型算法和整合专用硬件构建全新大模型训练体系结构,实现全新的软硬体系架构也许是一条解决芯片被“卡脖子”的方法,实现我们自己的大模型之路。

开放数据与公平评测。基础模型研究需要大量的算力和数据作为支撑,目前国内对基础模型的研究投入来自分散的数个科研团队和企业,重复建设现象比较严重。国外有The Pile、Common Crawl等大规模开放数据,但国内还缺少专门的组织进行大规模开放数据收集与共享。此外,在大模型评测方面我们也需要认真反思。ChatGPT是一个全世界范围的现象级产品,同时也得到全世界用户的“测试”,没有这种开放测试也不可能真正达到如今的效果。需要针对大模型的能力、安全、伦理等多方面问题,建立大模型的评测标准、评测方法和评测数据集,研究安全可控、符合道德伦理规范的大模型训练方法和生成方法。为帮助学术界、产业界更好地评判模型能力,需要各研究机构更加广泛地参与测评,创建更加公平的评测。笔者在IEEE成立了一个国际大模型能力与评测标准工作组,也欢迎产学研界研究者一起参与其中。

四、结束语

2024年是AGI元年,这一年注定将是不平凡的一年,我们需要在三个方面快速发展:短期推广大模型应用场景,给予大模型更大的落地发展空间;中期自研颠覆式大模型算法与技术,催生大模型与其他学科、产业的交叉发展新范式;长期布局基于大模型的通用人工智能AGI,瞄向世界领先行列。

大模型之路不再是简单的单个高校或者企业行为,更是国家战略。《人民日报》指出:大模型是新型AI基础设施的关键底座,大模型的竞争也是国家科技战略的竞争,中国一定要布局全栈自主创新的大模型产品。我们要专注自己原创的大模型理论、算法、产品,加速大模型以及基于大模型的通用人工智能的研发,帮助推动国家经济发展和产业升级。

唐 杰

CCF会士,CCF大模型论坛主席,CCCF前编委。清华大学计算机系讲席教授、人工智能研究院基础模型研究中心主任,ACM/AAAI/IEEE Fellow。主要研究方向为人工智能、认知图谱、数据挖掘、社交网络和机器学习。

相关资料

更多