Dataset for CCKS26 LLM-Generated Text Detection & Source Tracing Task
[TOC]
近年来,人工智能(AI)技术的快速发展正在深刻重塑人类内容创作的方式,人工智能生成内容(AIGC)已在新闻写作、教育辅导、社交媒体、办公协作等多个场景中广泛涌现。相较于图像、音频等模态,文本内容具有传播门槛低、生成成本低、应用范围广、社会影响直接等特点,一旦被大规模用于信息发布、舆论传播、学术写作或日常沟通,便可能带来内容真实性下降、责任归属模糊、滥用风险上升等问题。因此,面向文本领域开展大模型生成文本检测(LLM-Generated Text Detection)研究,不仅具有重要的学术价值,也对内容治理、平台审核、教育诚信和大模型安全应用具有现实意义。
在上一届 CCKS2025 中,主办方组织了“大模型生成文本检测”比赛,任务目标是判断一段文本属于“人类撰写”还是“机器生成”,即一个二分类任务。然而,随着大模型能力的持续提升以及人机协同创作模式的普及,越来越多的文本不再是纯粹的人类创作或纯粹的机器生成,而是在人机交互过程中共同完成。由此可见,传统的二分类设定已难以满足更加真实、更加细粒度的应用需求。与此同时,一个更进一步的问题也逐渐凸显:在识别文本是否由模型生成的基础上,能否进一步分析其生成来源,即判定其背后的生成模型家族?
基于上述背景,在本届 CCKS2026 赛事中,主办方紧跟大模型安全与治理的发展趋势,设计了一个更贴近真实应用场景的联合评测任务——大模型生成文本检测及溯源。该任务将文本检测与来源分析有机结合,采用统一评价模式,对参赛系统的综合能力进行评测。
具体而言,给定一段文本,系统首先需要判断其属于以下三类之一:
① 纯人类撰写;
② 纯机器生成;
③ 人机协作产生。
在此基础上,若系统判定文本为“纯机器生成”,还需要进一步识别其生成来源所属的模型家族。
为兼顾任务创新性与参赛可行性,本次评测在最终排名中采用“检测性能为主、溯源性能为辅”的统一加权评分方式,其中溯源分析仅针对纯机器生成文本进行评估。换言之,参赛系统只需在文本检测方面具备较强性能,即有机会取得较好的比赛成绩;而在溯源方面表现更优的系统,则有望展示更全面的能力。
中国科学院信息工程研究所依托阿里云天池平台在 CCKS2026 大会组织本次评测任务。
- 评测任务发布:4 月 28 日
- 报名时间:4 月 28 日—7 月 2 日
- 训练数据发布:5 月 15 日
- 测试 A 榜数据(测试集 A)发布:5 月 15 日
- 测试 A 榜评测截止:7 月 2 日
- 测试 B 榜数据(测试集 B)发布:7 月 3 日
- 测试 B 榜评测截止:7 月 10 日
- 评测排名通知:7 月 17 日
- 评测论文提交:8 月 3 日
- CCKS 2026 会议日期(评测报告及颁奖):8 月 21 日—23 日
报名方式:
4 月 18 日阿里云天池平台将开放本次比赛的组队报名、登录比赛官网,完成个人信息注册,即可报名参赛;选手可以单人参赛,也可以组队参赛。组队参赛的每个团队不超过 5 人,每位选手只能加入一支队伍。
选手报名、组队变更等操作截止时间为 7 月 2 日 23:59:59;各队伍(包括队长及全体队伍成员)需要在 7 月 2 日 23:59:59 前完成实名认证(认证入口:天池官网 - 右上角个人中心 - 认证 - 支付宝实名认证),未完成认证的参赛团队将无法进行后续的比赛。
选手需确保报名信息准确有效,组委会有权取消不符合条件队伍的参赛资格及奖励; B 榜前 10 名队伍将被要求提交代码进行复现审核,如果无法提交代码或结果相差较大将依次递补。
前若干名(等待组委会最终通知)队伍可提交评测论文,论文经审稿后如被接收,将发表于 CCKS2026 评测论文集(EI 索引)。
请扫码加入大赛官方钉钉群,最新通知将会第一时间在群内同步(“CCKS2026- 大模型生成文本检测及溯源”钉钉群号 166560023433):
报名规则:
- 大赛面向全社会开放,个人、高等院校、科研单位、企业、创客团队等人员均可报名参赛。中国科学院信息工程研究所/组织方内部员工均可报名参赛但无获奖资格;
- 所有参赛选手都必须在天池平台中注册、报名。参赛选手需确保注册时提交的信息准确有效,比赛资格及奖金支付均以提交信息为准;
- 参赛选手在天池中组队,参赛队伍成员数量不得超过 5 个,报名截止后不允许更改队员名单;
- 每支队伍需指定一名队长,队伍名称不超过 15 个字符,队伍名的设定不得违反中国法律法规或公序良俗词汇,否则组织者有可能会解散队伍;
- 每名选手只能参加一支队伍,一旦发现某选手以注册多个账号的方式参加多支队伍,将取消相关队伍的参赛资格。
系统开发规则:
- 开发工具:允许使用任何开源代码或工具,但禁止使用任何未公开发布或需要授权的代码或工具;鼓励使用大模型辅助系统设计或代码编写,允许在系统中引入 70B 以下的开源模型,但禁止在测试阶段调用任何在线闭源模型 API、商业大模型服务、互联网搜索服务或其他需要人工参与的人机交互方式;提交结果必须能够通过参赛队伍提交的代码和可获得资源离线复现。
- 数据增强:参赛选手仅允许基于训练集进行数据增强(例如通过裁剪、拆分、词语替换或格式调整等方法生成新的数据样本),但须确保严格保留原始数据的语义;禁止引入任何外部知识或生成完全新创的内容,不得使用额外的外部标注数据;禁止使用生成式大模型进行释义(paraphrase)操作,允许使用传统的编码器模型或 seq2seq 模型进行释义操作,前提是严格遵守语义保留的要求。
- 提交测试:参赛队伍可在参赛期间随时上传测试集的预测结果,A 榜每天 3 次、B 榜每天 5 次 ,排行榜每小时整点更新。
本次任务总奖金池为 20000 元,奖金设置如下:
- 第一名:人民币 10000 元,1 支队伍
- 第二名:人民币 5000 元,1 支队伍
- 第三名:人民币 2500 元,1 支队伍
- 创新奖:人民币 2500 元,1 支队伍
奖金说明:
若获奖者获得的现金奖励依法需代扣代缴相应税款,大赛组委会将根据相关税务法律法规要求向税务机关提供必要的税务申报信息(包括获奖者的身份信息、现金奖励金额等税务机关要求的信息),并由大赛组委会依法完成相应税款的代扣代缴,代扣代缴税款由获奖者承担。
获奖证书和评测论文投稿:
比赛优胜者会获得中国中文信息学会颁发的获奖证书,并有机会投稿评测论文。优秀的评测论文将被推荐至 CCKS 主会及对应期刊发表,将有机会在 CCKS 主会上分享研究成果。
B 榜排名前 10 名参赛队伍需额外提交相关材料以供资格审查,用于评定最终奖励。
提交材料:
一个压缩包,包括:
- 结果文件: 测试集预测结果(一个 jsonl 文件),命名为
submit.jsonl; - 系统代码: 要求提交所有的系统代码,确保程序能够正确运行,且所得结果与
submit.jsonl相符; - 方法及系统描述文档: 一个 pdf 或 markdown 文件(可带图片等附件),命名为
README.xxx,包含算法描述和系统运行配置两部分(注:非评测论文,评测论文撰写要求见 CCKS2026 官网)。
注意事项:
若没有提交上述材料,将视为自动放弃参与评奖。评奖资格将会自动顺延至排名紧随其后的队伍。选手需要将以上材料在截止日期前发送至邮箱 CCKS2026taskAIGC@163.com。邮件标题为 CCKS-评测任务AIGC-最终提交文件-参赛队名称,例如 CCKS-评测任务AIGC-最终提交文件-勇士队。代码需可运行以供组织者验证。若方法使用了额外公开的数据资源,需详细说明。
任务组织者:
曹亚男 (中国科学院信息工程研究所)
任昱冰 (中国科学院信息工程研究所)
汪卓商 (中国科学院信息工程研究所)
任务联系人:
任昱冰:renyubing@iie.ac.cn
汪卓商:wangzhuoshang@iie.ac.cn
学术指导组:
虎嵩林(中国科学院信息工程研究所)
刘燕兵(中国科学院信息工程研究所)
“大模型生成文本检测及溯源”联合评测任务将文本检测与来源分析有机结合,采用统一评价框架,对参赛系统的综合能力进行评测。
具体而言,给定一段文本,系统首先需要判断其属于以下三类之一: ① 纯人类撰写; ② 纯机器生成; ③ 人机协作产生。
在此基础上,若系统判定文本为“纯机器生成”,还需要进一步识别其生成来源所属的模型家族。
本次评测数据包括训练集、测试集 A 和测试集 B。训练集用于系统开发,测试集 A 用于排行榜评测,测试集 B 用于最终评测。所有数据文件以 jsonl 格式存储,每行是一个 json 对象。
| 文件名 | 纯人类撰写 | 纯机器生成 | 人机协作产生 | 发布时间 | |
|---|---|---|---|---|---|
| 训练集 | train.jsonl |
32000 | 32000 | 34800 | 5 月 15 日 |
| 测试集 A | test_a.jsonl |
4000 | 4000 | 4350 | 5 月 15 日 |
| 测试集 B | test_b.jsonl |
4650 | 6000 | 4350 | 7 月 3 日 |
训练集中,纯机器生成子集包含 8 个模型家族,每个模型家族含 4000 条样本,来自该家族中的 1 个较新模型和 1 个较旧模型。
测试集 A 与训练集分布类似;测试集 B 将引入更多新的语料集和更多样的数据,以考察系统的泛化性;保证测试集中数据样本的标签和各字段的取值,不会超出训练集(见下文“标签与字段定义”)。
本次评测任务的文本语料包含“纯人类撰写文本”、“纯机器生成文本”和“人机协作产生文本”三部分。其中:
- 纯人类撰写文本来自真实人类的评论、写作、新闻等内容
- 纯机器生成文本包含来自 8 个国内外主流大模型家族生成的文本(为降低比赛难度按厂商划分家族)
- 人机协作产生文本由人类和大模型通过多种方式协作产生
统一规定文本检测三分类标签(label 字段):
0:表示纯人类撰写1:表示纯机器生成2:表示人机协作产生
统一规定模型家族(family 字段)及其包含模型(model 字段):
0(OpenAI 家族):GPT系列1(Alibaba 家族):Qwen系列2(DeepSeek 家族):DeepSeek系列3(ByteDance 家族):Doubao系列4(Moonshot 家族):Kimi系列5(Google 家族):Gemini系列6(Anthropic 家族):Claude系列7(xAI 家族):Grok系列
统一定义人机协作模式(method 字段):
"machine-modify-human":使用机器对人类文本进行润色(polish)或重述(paraphrase)"machine-continue-human":将一段人类文本作为开头,使用大模型进行续写(continuation)- 长前缀(
long prefix):开头人类文本部分较长 - 短前缀(
short prefix):开头人类文本部分较短
- 长前缀(
"human-mix-machine":纯人类文本和纯机器文本互相混合(mixing)
训练集数据格式为:
- 每行是一个 json 对象,表示一个训练样本,包含数据文件内唯一样本标志符
id字段,以及具体的待测文本内容text字段 label为0表示纯人类撰写文本label为1表示纯机器生成文本,附加字段为具体生成模型model和模型家族familylabel为2表示人机协作产生文本,附加字段为具体协作方式method
train.jsonl 示例:
{"id": 1, "text": "这里是一段机器文本...", "label": 1, "model": "qwen3_max", "family": 1}
{"id": 2, "text": "这里是一段机器文本...", "label": 1, "model": "gpt_5", "family": 0}
{"id": 3, "text": "这里是一段人类文本...", "label": 0}
{"id": 4, "text": "这里是一段协作文本...", "label": 2, "method": "machine-modify-human"}
{"id": 5, "text": "这里是一段人类文本...", "label": 0}
{"id": 6, "text": "这里是一段协作文本...", "label": 2, "method": "machine-continue-human (long prefix)"}
{"id": 7, "text": "这里是一段协作文本...", "label": 2, "method": "human-mix-machine"}
{"id": 8, "text": "这里是一段机器文本...", "label": 1, "model": "doubao_seed_1_6", "family": 3}
{"id": 9, "text": "这里是一段机器文本...", "label": 1, "model": "qwen2_5_max", "family": 1}
...其中,model 和 method 字段仅作为训练集附加信息提供,正式评测不要求参赛系统输出具体模型名称或人机协作方式。
测试集可能含有与训练集不同领域的数据,参赛系统应考虑分类器的泛化性。无论检测或溯源,均保证测试集的样本标签集合是训练集的样本标签集合的子集(测试集 A 与测试集 B 中,纯机器生成样本均覆盖全部 8 个模型家族)。
测试集数据格式为:
每行是一个 json 对象,表示一个测试样本,包含数据文件内唯一样本标识符 id 字段,以及具体的待测文本内容 text 字段。
test.jsonl 示例:
{"id": 1, "text": "这里是一段待测文本..."}
{"id": 2, "text": "这里是一段待测文本..."}
{"id": 3, "text": "这里是一段待测文本..."}
...本次任务的官方评估指标定义为(详细指标计算公式见附录):
其中:
-
$F1_{\text{detect}}$ :评估参赛系统在文本检测任务上的性能,即在全部测试样本上,针对三分类标签计算的 Macro-F1 分数; -
$F1_{\text{source}}$ :评估参赛系统在溯源(模型家族识别)任务上的性能,即仅在真实标签为“纯机器生成”的测试样本子集上,针对模型家族标签计算的 Macro-F1 分数。
注意:
- 系统需正确识别出纯机器文本之后,才有机会拿到溯源分。主办方鼓励参赛队伍优先提升系统的检测能力,在保证检测能力的前提下进一步尝试溯源。
- 仅当某条样本的真实标签为“纯机器生成”时,该样本才会被纳入溯源评测范围。对于这部分真实标签为“纯机器生成”的样本:
- 若参赛系统将其正确预测为
1(纯机器生成),则进一步读取其提交的family字段,并与真实模型家族标签进行比较; - 若参赛系统预测错误,则该样本在溯源部分直接记为错误。
- 若参赛系统将其正确预测为
- 若某条样本在文本检测部分的真实标签为“纯人类撰写”或“人机协作产生”,即使系统误将其预测为“纯机器生成”,该样本不参与溯源部分的评测,因此不会直接影响
$F1_{\text{source}}$ 的计算。
本次任务采取刷榜的方式,主办方根据真实标签和评价指标对参赛队伍提交的预测结果进行评估。
测试集发布后,允许参赛队伍随时向平台提交预测结果文件 submit.jsonl。其中每一行为一个 json 对象,表示对测试集中单条样本的预测结果,包含三个字段:
- 测试样本 ID(
id字段):测试样本在测试集中的唯一 ID 标志符,应与测试集保持一致 - 三分类预测结果(
label字段):系统对该条测试样本的三分类预测结果,取值为一个数字,应来自:0(表示纯人类撰写)1(表示纯机器生成)2( 表示人机协作产生)
- 溯源预测结果(
family字段):若系统在label字段的预测结果为0或2即认为当前样本为纯人类撰写或人机协作产生,则family字段为-1(评测时不作考虑);否则,若系统在label字段的预测结果为1即认为当前样本为纯机器生成,则family字段应给出对当前样本的源生成模型的预测,取值为一个数字,应来自:0(OpenAI 家族)1(Alibaba 家族)2(DeepSeek 家族)3(ByteDance 家族)4(Moonshot 家族)5(Google 家族)6(Anthropic 家族)7(xAI 家族)
submit.jsonl 示例:
{"id": 1, "label": 2, "family": -1}
{"id": 2, "label": 1, "family": 1}
{"id": 3, "label": 0, "family": -1}
{"id": 4, "label": 1, "family": 4}
{"id": 5, "label": 1, "family": 0}
...组织方使用所有真实标签为 label=1 的样本,构造溯源任务评测集。对于参赛队伍提交的预测文件,评测脚本将仅针对那些label字段预测值为 1的样本的 family 字段进行溯源评测;对于其余label字段预测值非1的样本,在溯源评测中其family字段一律视为无效标签 -1。最终仅以合法 family 标签集合 {0,1,2,3,4,5,6,7} 计算 Macro-F1,未落入该集合的预测视为漏检。
注意事项:
阿里云天池平台 A 榜阶段每天可提交 3 次、B 榜阶段每天可提交 5 次;每小时整点更新各队伍的最新排名情况。
B 榜排名前 10 名参赛队伍需额外提交相关材料以供资格审查,用于评定最终奖励。
提交材料: 一个压缩包,包括:
- 结果文件: 测试集预测结果(一个 jsonl 文件),命名为
submit.jsonl; - 系统代码: 要求提交所有的系统代码,确保程序能够正确运行,且所得结果与
submit.jsonl相符; - 方法及系统描述文档: 一个 pdf 或 markdown 文件(可带图片等附件),命名为
README.xxx,包含算法描述和系统运行配置两部分(注:非评测论文,评测论文撰写要求见 CCKS2026 官网)。
注意事项:
若没有提交上述材料,将视为自动放弃参与评奖。评奖资格将会自动顺延至排名紧随其后的队伍。选手需要将以上材料在截止日期前发送至邮箱 CCKS2026taskAIGC@163.com。邮件标题为 CCKS-评测任务AIGC-最终提交文件-参赛队名称,例如 CCKS-评测任务AIGC-最终提交文件-勇士队。代码需可运行以供组织者验证。若方法使用了额外公开的数据资源,需详细说明。
在文本检测任务中,每条样本的真实标签和预测标签均属于以下三类之一:
0:纯人类撰写1:纯机器生成2:人机协作产生
记三分类标签集合为:
对于任意类别
其中:
-
$TP_c$ 表示被正确预测为类别$c$ 的样本数; -
$FP_c$ 表示被错误预测为类别$c$ 的样本数; -
$FN_c$ 表示真实类别为$c$ 、但未被预测为$c$ 的样本数。
在此基础上,文本检测部分的 Macro-F1 定义为三个类别 F1 的算术平均值:
溯源任务仅针对真实标签为“纯机器生成”的样本进行评估。设这部分样本对应的真实模型家族标签集合为:
分别表示:
0(OpenAI 家族)1(Alibaba 家族)2(DeepSeek 家族)3(ByteDance 家族)4(Moonshot 家族)5(Google 家族)6(Anthropic 家族)7(xAI 家族)
对于任意模型家族类别
溯源部分的 Macro-F1 定义为所有模型家族类别 F1 的算术平均值:
