AI大模型· 第 2 / 2 页
大模型的测试与评价
测试
- 大模型的测试需要考虑以下几个方面:
- 模型的准确性:模型在测试数据集上的表现
- 模型的鲁棒性:模型对噪声、对抗样本等干扰的抵抗能力
- 模型的效率:模型的运行速度和资源消耗
评价
- 大模型的评价需要考虑以下几个方面:
- 模型的性能:模型在特定任务上的表现
- 模型的泛化能力:模型在不同数据集上的表现
- 模型的公平性:模型是否对所有用户公平
- 模型的安全性和可靠性:模型是否安全可靠
常用的测试和评价指标
- 准确率:模型预测正确的比例
- 精确率:模型预测为正例的样本中,真实正例的比例
- 召回率:真实正例中,被模型预测为正例的比例
- F1分数:精确率和召回率的调和平均值
- BLEU分数:机器翻译模型的评价指标
- ROUGE分数:文本摘要模型的评价指标
专业名词大全
更细专业名词,见文档——》:AI术语名词
1、算法:
类比碳基物种,硅基物种的大脑就是模型。我们现在说的算法(比如Transformer)代表大脑(模型)的能力,Transformer的出现确实极大程度地推动了AI的发展。但现阶段,在处理多模态数据时还有很大挑战,在算法层面未来一定会有新的突破。
2、模型参数:
一个刚出生的人类幼崽随着年龄的增长,大脑本身在增长,模型参数的数量增加可以类比人类大脑本身的成长和成熟;随着人类幼崽成长中接触的事物增加,大脑的认知在改变,参数的数值可以类比人类利用外界信息给自己构建的认知。
3、训练数据:
人类成长过程中对认知的构建,70%是通过视觉,20%是通过听觉,其他包括味觉、触觉、嗅觉等等,通过这些感官接受这个世界的信息来构建对世界的了解。模型的训练数据某种程度类比于这些信息,你让模型看到了多少和什么质量的数据,决定了他未来的认知,即参数的数量和数值。
4、Token:
我们常常会听到Token这个词,Token的概念相当于文字,一个中文文字对应一个token,比如冰激凌,对应三个token:冰+激+凌;一个英文的字符对应一个token,比如icecream,对应两个token:ice+cream。
5、175B、60B、540B等:
这些一般指参数的个数,B是Billion/十亿的意思,175B是1750亿参数,这是ChatGPT大约的参数规模。
6、强化学习:(Reinforcement Learning)一种机器学习的方法,通过从外部获得激励来校正学习方向从而获得一种自适应的学习能力。
7、 基于人工反馈的强化学习(RLHF):
(Reinforcement Learning from Human Feedback)构建人类反馈数据集,训练一个激励模型,模仿人类偏好对结果打分,这是GPT-3后时代大语言模型越来越像人类对话核心技术。
8、涌现:
(Emergence)或称创发、突现、呈展、演生,是一种现象。许多小实体相互作用后产生了大实体,而这个大实体展现了组成它的小实体所不具有的特性。研究发现,模型规模达到一定阈值以上后,会在多步算术、大学考试、单词释义等场景的准确性显著提升,称为涌现。
9、泛化:
(Generalization)模型泛化是指一些模型可以应用(泛化)到其他场景,通常为采用迁移学习、微调等手段实现泛化。
10、微调:
(FineTuning)针对大量数据训练出来的预训练模型,后期采用业务相关数据进一步训练原先模型的相关部分,得到准确度更高的模型,或者更好的泛化。
11、指令微调:
(Instruction FineTuning),针对已经存在的预训练模型,给出额外的指令或者标注数据集来提升模型的性能。
12、思维链:
(Chain-of-Thought,CoT)。通过让大语言模型(LLM)将一个问题拆解为多个步骤,一步一步分析,逐步得出正确答案。需指出,针对复杂问题,LLM直接给出错误答案的概率比较高。思维链可以看成是一种指令微调。