❝哈喽,我是树酱。今天分享的是海内外大模型排行榜单。最近发现CompassRank司南大模型评测这个网站(上海人工智能实验室出品)。号称致力于探索最先进的大模型,为产研界提供全面、客观、中立的评测参考!

最新的数据在1月份,下文以1月为维度看下最新前10排行
大语言模型官方自建榜单

国内大模型还是很强劲,排名前后分别是Deepseek、字节的Doubao、阿里的Qwen2.5-Max等等
多模态模型榜
❝多模态大模型,顾名思义,是指能够处理多种类型数据(如图像、文本、声音等)的深度学习模型。

国内Qwen2.5-VL-72B排名第一!
模型详细
司南支持多维度评估模型能力,同时也支持不同模型对比,通过多维度对比不同模型的能力。其中包括:语言、知识、推理、数学、代码、指令跟随等等
以Qwen2.5-Max与DeepSeek R1比较为例👇

综合评分对比

模型模拟对战(Compass Arena)
司南支持不同模型之间的模拟对战,对比实际效果。同时支持匿名对战和自选对战。

最终结合众多模拟对战数据,决策该分数对大模型进行排名。

官网地址:https://rank.opencompass.org.cn/home

4162




被折叠的 条评论
为什么被折叠?



