新华社研究院《人工智能大模型体验报告2.0》(附下载):百度文心一言表现最为抢眼;商汤商量、智谱AI ChatGLM、 360智脑表现优良;讯飞星火、阿里通 义千问、澜舟科技Mchat、昆仑万维天工表现尚佳

2023年8月12日,新华社研究院中国企业发展研究中心发布《人工智能大模型体验报告2.0》。与2023年6月发布的1.0报告相比,当前中国大模型产品进步显著,具体来看,科大讯飞的星火在工作提效方面优势明显;百度文心一言地基深厚、基础能力仍处领军水准;商汤商量则在情商方面表现优秀;智谱AI 的ChatGLM整体表现优秀。

今年以来,国内科技企业纷纷布局人工智能大模型。据不完全统计,在新一轮生成式AI热潮中,国内已经出现了上百个大模型。

通用大模型应用:360智脑-360;WAI-微盟;WPS AI-金山办公;孔明-软通智慧;超拟人大模型-聆心智能;赤兔-容联运;混元-腾讯;九天-中国移动;源-浪潮;盘古-华为;日日新-商汤;天工-昆仑万维;天书-云天励飞;通义千问-阿里云;文心一言-百度;西湖-西湖心辰;星河-中国电信;星火-科大讯飞;序列猴子-出门问问;玉颜、丹青-网易伏羲;知海图-知乎;紫东太初-中科院;

垂直大模型应用:
----教育----子曰-有道
----金融----ChatABC-中农行
----媒体----Baker-GPT-标贝科技;Graph-AIGC-图宇宙
----汽车----DriveGPT-毫末智行
----医疗----HealthGPT-叮当;medGPT-医联;左医GPT-左手医生;
----游戏----DRL-rct AI;GAEA-超参数

天眼查数据显示,截至2023年上半年,与“大模型”直接相关的融资事件超20起。为进一步直观感受我国当前主流科技企业所推出的大模型产品的现状、优势和特点,新华社研究院中国企业发展研究中心于2023年7月启动了本次报告研究。

与2023年6月首次发布的《人工智能大模型体验报告》相比,本次测评在题目设计、对标Benchmark(人类)、打分权重、专家测评团队四大维度进行了全面升级。其中,在题目设计方面,测评题目由300道扩展至500道,并进一步完善了题目分类;在对标Benchmark方面,本次测评将接受过高等教育的人类作为对照,来考评大模型真实能力;在打分标准上,本次测评根据对产业、生活的实际价值,对基础能力、智商能力、情商能力和工具提效四大测评维度进行了权重设计;在测评团队方面,本次测评特邀北京大学文化与传播研究所及其他产界、学界专家全程参与。

本次研究设置了用户体验项目,抓取了7月31日—8月4日数据,通过人机互动提问等形式,对国内主流大模型进行使用体验评测,旨在为科技企业调整努力方向提供参考。报告显示,与2023年6月相比,当前中国大模型产品进步显著。但与接受过高等教育的人类相比,大模型在智商、情商等方面还存在一定程度差距。具体来看,讯飞星火在工作提效方面优势明显,百度文心一言基础能力仍处领军水准,商汤商量则在情商方面表现优秀,智谱AI-ChatGLM整体表现优秀。

640-1

针对各维度能力测评,该报告还给出了相应的案例展示和分析。

在基础能力方面,人类与AI之间的差距并不显著。课题组分别从语言能力(35%)、AI向善(10%)、跨模态(20%)和多轮对话(35%)四大指标进行测评。测评显示,科技企业大模型中,百度文心一言表现最为抢眼,商汤商量、智谱AI-ChatGLM、360智脑表现优良。

在智商评估方面,人类在智商方面仍然具有明显优势。课题组分别从常识知识(20%)、逻辑能力(50%)和专业知识(30%)方面对科技企业大模型进行考量。结果显示,讯飞星火、智谱AI-ChatGLM表现突出,百度文心一言、昆仑万维天工表现优良。

在情商方面,AI与人类之间的差距最为明显。人类在情绪理解和处理方面通常具有更强的优势,和更灵活的处理能力。通过对处理日常事项(35%)、一语双关(30%)、人际关系(35%)问题进行分析发现,科技企业大模型中,商汤商量表现亮眼,百度文心一言、澜舟科技Mchat、智谱AI-ChatGLM及360智脑均表现优良。

在工作效率提升方面,课题组重点在工具提效(50%)和生成创新(50%)方面进行考量。结果显示,讯飞星火表现最为抢眼,百度文心一言、商汤商量、智谱AI-ChatGLM表现优良。不过,尽管AI具有高速度和高效率的优势,但在某些复杂和具有创新性的任务中,人类的智慧和想象力仍然具有无法替代的作用。

报告认为,虽然在不同领域中,AI和人类表现出不同的优劣势,但在整体上,AI大模型的发展为人类工作和生活的提质增效带来了重要的积极影响,大模型正在加速走进生活、走进产业。在本次体验测评基础上,研究团队将继续深耕,加强在大模型安全可解释性、工作提效能力、实际落地情况、产业优秀案例等维度上的探索与研究。

报告总结:

经过大半年的发展,大模型正在加速走进生活,走进产业。以往AI 模型针对不同场景往往需要重复开发,导致效率低下。大模型的出现为这一挑战提供了新的解决思路,将加速推动产业向全链路智能发展。

国家网信办联合国家发展改革委、教育部、科技部、工业和信息化部、公安部、广电总局公布的《生成式人工智能服务管理暂行办法》进一步为大模型发展指明了方向。国家将坚持发展和安全并重、促进创新和依法治理相结合的原则,采取有效措施鼓励生成式人工智能创新发展。

在政府、企业和社会各方的共同努力下,中国大模型的产业生态已经初步形成。面向未来,各大厂商应更好地发挥各自优势。头部厂商继续发力自研大模型,而专注于解决方案的行业厂商可以考虑通过深耕垂类来彰显特色。此外,头部企业应该通过开放平台等方式对外赋能,促进大模型技术的共享和创新,加速其落地和推广,承担起技术发展的社会责任。

大模型+行业的发展将发挥越来越重要的作用。目前大模型在金融、工业、医疗等领域已经取得了显著成果,持续探索如何为行业领域提供更精准、高效的解决方案成为大模型厂商弯道超车的机会,未来通过新一代AI能够打造其独特的竞争优势。只有通过各方的共同努力和合作,才能够推动中国大模型技术的应用落地,最终实现人工智能产业的快速发展和跨越式进步。

以下为报告正文(文末附下载):

be0926d044d29577e85494df9262726b

 

来源:新华社研究院

报告下载>>

【END】

为您推荐

发表回复