美文网首页
大语言模型测试数据集持续更新

大语言模型测试数据集持续更新

作者: NazgulSun | 来源:发表于2023-09-14 19:31 被阅读0次

1、中文数据集

AGIEval

AGIEval:https://github.com/ruixiangcui/AGIEval
其中的中文数据集:

  • 高考
  • 法律考试数据集
  • 国家公务员考试
    image.png
    测试在使用的数据集
  • Baichuan2-13B

C-EVAL 中文数据集

https://zhuanlan.zhihu.com/p/630111535
多项式选择题,13948道题目,跨52个领域。
如下图所示:包括了初、高、大学的学科;社会科学,人文类的,还有各类认证考试。
目前看这些测试集为啥都是考试类的。

image.png

CMMLU 数据集

构建方式与C-EVAL貌似差不多。除了涵盖人文科学、社会科学、STEM(科学、技术、工程和数学)以及其他在人类日常生活中很重要的四个通用领域的知识外,还涵盖一些特定领域的知识,用于验证模型的中国知识的蕴含能力以及对中文的理解和适应能力。


image.png

SuperCLUE

https://www.cluebenchmarks.com/superclue.html
与其他数据集有些不一样的地方,关注了更多的能力方面,而不是局限于做题。
目前的问题是,没有开放数据集,另外就是文本生产类的问题,也不知道是如何评测的,评测方法是什么。
毕竟选择题是有很明确的标注答案,写作文就是见仁见智。

image.png
image.png

GAOKAO-Bench

题目类型 题目数量 数量占比
选择题 1781 63.36%
填空题 218 7.76%
解答题 812 28.89%
题目总数 2811 100%


包含了解答题这样的类型,需要人工评测,这个目前依旧是aigc领域最大的评测问题,对于写作生产类的任务,如何来评测。
https://github.com/OpenLMLab/GAOKAO-Bench/tree/main

2、常见的应用数据集

GSM-8K

https://github.com/openai/grade-school-math#grade-school-math
GSM8K consists of 8.5K high quality grade school math problems created by human problem writers.
高质量的数学题目,感觉还挺难的,openai使用的评测集合。

HumanEval数据集

包括164个人工手写的编程问题,其中每个编程问题包括函数头、docstrings、函数体和几个unittests。HumanEval中的编程问题可以用来评估语言理解能力、推理能力、算法能力和简单的数学能力。
整个设计是标准数答案,设定通过的checkpoint。aigc类的task是不是可以借鉴这样的思路去评测。


image.png

MBPP数据集

包含974个编程任务,人给出所需程序的描述,引导模型生成正确的代码。
与HumanEval不一样的是,H主要是通过docString,而MBPP是通过description来生产,更加接近自然语言的instruction。

MedQA_USMLE

https://github.com/jind11/MedQA
医疗领域的专业大模型
依旧是选择题的模式,因为好评价,而问答提的模式,需要依赖人工评测。

JEC-QA

中国司法考试数据集,主要也是多选选择题。

百川用到的这些评测数据集。
对于AIGC类的任务,感觉可能代码评测类效果好的模型,会比较有优势。


image.png

相关文章

  • task3

    过拟合、欠拟合及其解决方案 训练集和测试集 测试数据集不可以用来调整模型参数,如果使用测试数据集调整模型参数,可能...

  • 线性回归

    数据集分为训练数据和测试数据,训练数据用来训练模型参数,测试数据用来检验该模型的准确程度。 损失函数预测值与真实值...

  • 机器学习0

    1. 数据集 训练数据:用于训练,构建模型; 测试数据:在模型检验时使用,用于评估模型是否有效。 load和fet...

  • 模型效果上限预估、分类模型Bad Case分析方法

    模型效果上限预估、分类模型Bad Case分析方法 给定训练和测试数据集,训练某个二分类模型(如,GBDT算法),...

  • 模型评估与模型选择

    训练误差是模型Y=f(x)关于训练数据集的平均损失 测试误差是模型Y=f(x)关于测试数据集的平均损失 损失函数为...

  • 方差-偏差权衡

    不要考虑测试数据, 只考虑训练数据. 模型的复杂度对应了模型对训练集的拟合度, 模型越复杂, 拟合度越高. 对于训...

  • 如何评价模型的好坏

    1.训练数据集&测试数据集 将原始数据中的一部分作为训练数据、另一部分作为测试数据。使用训练数据训练模型,再用测试...

  • 神经网络优化算法:Dropout、梯度消失/爆炸、Adam优化算

    1. 训练误差和泛化误差 机器学习模型在训练数据集和测试数据集上的表现。如果你改变过实验中的模型结构或者超参数,你...

  • R学习笔记(15):一个建模实例

    1. 建模 2. 如何判断模型好坏 2.1 自建测试数据集,根据模型用预测的x~y关系绘图,在图上比较 expan...

  • 2018-12-12

    1.4模型评估与模型选择 1.4.1训练误差与测试误差 测试误差反映了学习方法对未知的测试数据集的预测能力,是学习...

网友评论

      本文标题:大语言模型测试数据集持续更新

      本文链接:https://www.haomeiwen.com/subject/euamvdtx.html