手册AI

大模型评测

手册 · 覆盖 AI,约 4 分钟。

手册·约 4 分钟·更新 2026-09·纠错 / 投稿

官方评测:

大模型标准符合性评测

该测试由工信部中国电子技术标准化研究院(简称“工信部电子标准院”)发起,评测围绕多领域多维度模型评测框架与指标体系,从大模型的通用性、智能性、安全性等维度开展,涵盖语言、语音、视觉等多模态领域,旨在建立大模型标准符合性名录,引领人工智能产业健康有序发展。

旨在建立中国大模型标准符合性名录,引领人工智能产业健康有序发展。该评测对外征集了学术界、产业界几十家头部单位意见,覆盖评估语言大模型通用性、智能性的38项具体评测维度,是基于官方大模型测试基准的权威评测。

在12月22日的全国信息技术标准化技术委员会人工智能分委会全体会议上,腾讯混元大模型、阿里通义千问、百度文心一言、360智脑等四款国产大模型首批通过了“大模型标准符合性评测”,其中通义千问是唯一的开源模型。这项评测由中国电子技术标准化研究院发起,旨在建立中国大模型标准符合性名录,并引领人工智能产业健康有序发展。该评测覆盖了30余项具体评测维度,包括语言大模型通用性和智能性。

《人工智能大模型体验报告》

(1.0、2.0、3.0版本)

新华社研究院中国企业发展研究中心于2023年4月至10月启动了三次测评研究,对国内主流大模型进行使用体验评测,旨在为科技企业调整努力方向提供参考。

其中3.0版本研究抓取了2023年10月25日-2023年11月6日的数据,通过人机互动提问等形式,对国内主流大模型进行使用体验评测。在评测过程中,不仅考虑模型产品的实际表现,还深入评估了厂商的技术实力和未来发展潜力。此外,评测题库扩充到了1000道,并精选其中的400道进行实际问答测试。这大大提升了评测的广度和深度,能更准确地反映大模型在不同场景和问题下的实际表现。报告显示,科大讯飞星火继续保持领先优势,商汤商量、智谱AI-ChatGLM等厂商整体表现优秀。针对各维度能力测评,该报告还给出了相应的案例展示和分析。

机构评测

目前评测机构很多,按照机构背景大体可以分为两类:

相关资料

更多