近来,人工智能大模型风云起涌,不少科技企业加快拓宽应用生态。主流大模型的实际使用感受如何?各大科技企业有何优劣势?8月12日,新华社研究院中国企业发展研究中心发布的《人工智能大模型体验报告2.0》(以下简称报告)显示,讯飞星火、百度文心一言、商汤商量和智谱AI-ChatGLM均表现抢眼,AI大模型的发展为人类工作和生活的提质增效均带来了正向积极的影响。
(资料图)
今年以来,国内科技企业纷纷布局人工智能大模型。据不完全统计,在新一轮生成式AI热潮中,国内已经出现了上百个大模型。天眼查数据显示,截至2023年上半年,与“大模型”直接相关的融资事件超20起。
为进一步直观感受我国当前主流科技企业所推出的大模型产品的现状、优势和特点,新华社研究院中国企业发展研究中心于今年7月启动了本次报告研究。与2023年6月首次发布的《人工智能大模型体验报告》相比,本次测评在题目设计、对标Benchmark(人类)、打分权重、专家测评团队四大维度进行了全面升级。
其中,在题目设计方面,测评题目由300道扩展至500道,并进一步完善了题目分类;在对标Benchmark方面,本次测评将接受过高等教育的人类作为对照,来考评大模型真实能力;在打分标准上,本次测评根据对产业、生活的实际价值,对基础能力、智商能力、情商能力和工具提效四大测评维度进行了权重设计;在测评团队方面,本次测评特邀北京大学文化与传播研究所及其他产界、学界专家全程参与。
本次研究设置了用户体验项目,抓取了7月31日—8月4日数据,通过人机互动提问等形式,对国内主流大模型进行使用体验评测,旨在为科技企业调整努力方向提供参考。
报告显示,与2023年6月相比,当前中国大模型产品进步显著。但与接受过高等教育的人类相比,大模型在智商、情商等方面还存在一定程度差距。具体来看,讯飞星火在工作提效方面优势明显,百度文心一言基础能力仍处领军水准,商汤商量则在情商方面表现优秀,智谱AI-ChatGLM整体表现优秀。
针对各维度能力测评,该报告还给出了相应的案例展示和分析。
在基础能力方面,人类与AI之间的差距并不显著。课题组分别从语言能力(35%)、AI向善(10%)、跨模态(20%)和多轮对话(35%)四大指标进行测评。测评显示,科技企业大模型中,百度文心一言表现最为抢眼,商汤商量、智谱AI-ChatGLM、360智脑表现优良。
在智商评估方面,人类在智商方面仍然具有明显优势。课题组分别从常识知识(20%)、逻辑能力(50%)和专业知识(30%)方面对科技企业大模型进行考量。结果显示,讯飞星火、智谱AI-ChatGLM表现突出,百度文心一言、昆仑万维天工表现优良。
在情商方面,AI与人类之间的差距最为明显。人类在情绪理解和处理方面通常具有更强的优势,和更灵活的处理能力。通过对处理日常事项(35%)、一语双关(30%)、人际关系(35%)问题进行分析发现,科技企业大模型中,商汤商量表现亮眼,百度文心一言、澜舟科技Mchat、智谱AI-ChatGLM及360智脑均表现优良。
在工作效率提升方面,课题组重点在工具提效(50%)和生成创新(50%)方面进行考量。结果显示,讯飞星火表现最为抢眼,百度文心一言、商汤商量、智谱AI-ChatGLM表现优良。不过,尽管AI具有高速度和高效率的优势,但在某些复杂和具有创新性的任务中,人类的智慧和想象力仍然具有无法替代的作用。
报告认为,虽然在不同领域中,AI和人类表现出不同的优劣势,但在整体上,AI大模型的发展为人类工作和生活的提质增效带来了重要的积极影响,大模型正在加速走进生活、走进产业。在本次体验测评基础上,研究团队将继续深耕,加强在大模型安全可解释性、工作提效能力、实际落地情况、产业优秀案例等维度上的探索与研究。
(文章来源:经济参考网)
标签:
近来,人工智能大模型风云起涌,不少科技企业加快拓宽应用生态。主流大
近日云从科技披露,截至2023年6月30日公司股东户数为3 7万户,较3月31
你是否遇到过某个MCU串口不够的情况?这时我们可以考虑用GPIO去模拟
黑脸的解释黑脸是一个有着历史渊源的词汇,在中文语境中有着不同的含义
联想电脑上门维修电话随着科技的进步,电脑已经成为现代人必不可少的日
1、心理学在大学里是小学科,临床心理学一般也不会在心理学系的,将来
来为大家解答以上的问题。50岁是什么之年:知命,50岁是什么之年这个很
“问题总算解决了!每当遇到雨天,地下车库顶上漏水像‘水帘洞’一...
据扬州市总工会微信公众号消息,8月9日,江苏省扬州市总工会联合市邮政
大皖新闻讯受短时局部强降雨影响,8月11日18时许,西安市长安区滦镇街
人民网北京8月12日电(记者李博)为高效有序有力推动自然灾害恢复重建工
据了解,国产青春喜剧动画电影《茶啊二中》自7月14日上映以来,票房已
nsist的用法,insist怎么用很多人还不知道,现在让我们一起来看看吧!1
8月11日,工银上证科创50成份ETF最新单位净值为0 9684元,累计净值为0
在今夏,他也是代表勇士出战夏季联赛,场均拿到5 6分6 8篮板,可以看出
今天招生网小编整理了武汉大学广东录取分数线武汉大学广东招生人数多少
来为大家解答以上的问题。坦克世界盒子怎么用不了了,坦克世界盒子怎么
导读1、坏了。2、在买一个。本文到此讲解完毕了,希望对大家有帮助。免
燃气安全关乎生命财产安全,容不得一丝大意。近期来,中牟县广惠街街道
记者:预计拉维亚本周末离开圣徒,他已向一些球员和工作人员道别,圣徒,
精测电子公告,公司控股子公司深圳精积微半导体技术有限公司近日与客户
台风、暴雨等天气导致劳动者上班迟到甚至不能正常上班,那么这种情况下
齐鲁网•闪电新闻8月11日讯记者从昨天在北京举行的主题为“全沉浸新商
冠军之路永无止境。8月8日,在北京奥运会成功举办15周年之际,瑞虎8冠
智通财经APP讯,信利国际(00732)发布公告,相较截至2022年6月30日止6个
推动实体经济高质量发展,需要金融的大力支持。
视频:武汉大学中南医院与荆州二医医联体签约授牌荆州新闻网消息(记者
来为大家解答以上问题,索爱s35app,索爱w302软件很多人还不知道,现在
浙江金华:8月16日起取消住宅限售,推行二手房跨行“带押过户”-8月...
国内专业排名概况介绍:在各大学校中,每个专业都各具特色,并且就业前