司南OpenCompass 2.0评测GLM-4稳坐国内榜首，智谱AI大模型实力强悍-CSDN.NET

CSDN首页> 业界

订阅业界RSS

司南OpenCompass 2.0评测GLM-4稳坐国内榜首，智谱AI大模型实力强悍

发表于 2024-05-22 18:01:36

近期，大模型开源开放评测体系司南（OpenCompass 2.0）公布了2024年4月大语言模型最新评测榜单，智谱AI的GLM-4继续保持国产大模型第一的领先身位。

大模型开源开放评测体系司南（OpenCompass 2.0）由上海人工智能实验室发布。其月度榜单从基础能力和综合能力的设计出发，构建了一套高质量的中英文双语评测基准体系，对主流开源模型和商业API模型进行了全面评测分析。评测榜单涉及的大语言模型和多模态大模型超过150个，更有包括Meta、阿里巴巴、腾讯、百度等30余家国内外企业和科研机构采用OpenCompass助力开展技术研发。

在4月客观评测榜单中，OpenCompass基于语言、知识、推理、数学、代码、智能体六个维度构建了15000余道高质量中英文双语问题，并引入OpenCompass团队首创的循环评估 (Circular Evalution) 策略，系统性分析了国内外大模型的客观性能。其中，GLM-4位列第四名，仅次于GPT-4-Turbo系列与Claude3-Opus，成为国内大模型客观评测月度总榜第一名。在语言维度方面，GLM-4分数达到57.7分表现突出，超过GPT-4-Turbo系列与Claude3-Opus。在知识维度上，GLM-4得到68.9分，超过第二名的GPT-4-Turbo-1106，与第三名Claude3-Opus不相上下。

值得一提的是，GLM-4此前便长期占据OpenCompass 2.0榜单前列，并多次在权威榜单与全球顶级大模型一较高下。清华《SuperBench大模型综合能力评测报告》显示，GLM-4在语义理解等方面的能力表现超过了GPT-4-Turbo等国际一流模型，在代码、智能体等方面，排名国内第一。在SuperCLUE-Fin(SC-Fin)中文原生金融大模型测评基准中，GLM-4斩获一项A+及多项A级评价，在国内大模型中排名第一。

据了解，GLM-4是由智谱AI于今年1月推出的新一代基座大模型。GLM-4整体性能逼近GPT-4，它可以支持更长的上下文，具备更强的多模态能力。同时，它的推理速度更快，支持更高的并发，大大降低推理成本。依托GLM-4 All Tools能力，GLM-4智能体能够实现自主根据用户意图，自动理解、规划复杂指令，自由调用网页浏览器、Code Interpreter代码解释器和多模态文生图大模型以完成复杂任务。

开发者可以通过智谱AI大模型开放平台bigmodel.cn接入GLM-4模型开放API，便捷高效地体验GLM-4的强大能力。

「免责声明」：以上展示页面信息由第三方发布，目的在于传播更多信息，与本网站立场相关。我们不保证该信息（包括但不限于文字、数据及图表）全部或者部分内容的准确性、真实性、完整性、完整性、及时性、原创性等。相关信息须经网站核实，若您提出任何投资建议，据此操作，风险自担，以上网页提交的图片由此上传，如发生图片关联行为与我们关联，如有请直接微信联系g1002718958。

CSDN官方微信

扫描二维码,向CSDN吐槽

微信号：CSDNnews

程序员移动端【订阅下载】

微博关注

【免责声明：CSDN本栏目发布信息，目的在于传播更多信息，丰富网络文化，稿件仅代表作者个人观点，与CSDN无关。其原创性以及文中陈述文字和文字内容未经本网证实，对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本网不做任何保证或者承诺，请读者仅作参考，并请自行核实相关内容。您若对该稿件有任何怀疑或质疑，请立即与CSDN联系，我们将迅速给您回应并做处理。】