01
上周一,我发了自己做的AIHOT大模型排行榜。
有很多朋友感兴趣,在文章下面评论,最高赞的一条,是在问能不能有个分类测评,能够评估不同模型做不同任务的表现。
讲道理,这其实一直是我想做的,也是我觉得特别特别核心的痛点。
现在的大模型榜单很多,比如LiveBench、DeepSWE之类的,可以很快知道哪个模型在某一个能力维度上更强,像Coding、数学、浏览器操作等等。
但是有一类评测集,其实是最稀缺的。
就是模型在真实工作中的实际完成效果。
比如金融领域、法律领域、电商领域、生活领域等等等等,就是直接给它一份真实工作,让它自己从头干到尾,最终看工作效果,而这些,我觉得其实才更符合真实用户的日常工作和生活,也对大家更有用。
所以,在分类上,我一直想把这些场景给补上,把这个排行榜的维度,变得更加丰富和多维化。
于是,这个周末,我几乎把所有的评测集都翻了一遍,不翻不知道,一翻才吓一跳,这块的评测集,真的少的太可怜的,真的可以用寥寥无几来形容。
0
评论 (0)