XGuard护栏揭榜赛
约 1083 字大约 4 分钟
2026-04-09
逆袭吧创二代
比赛规则
1.任务要求
- 选手需基于 XGuard 开源数据集(允许扩充新数据),结合 XGuard 模型或其他开源模型(10B 及以下),训练并提交专属的安全护栏模型。模型需具备与 XGuard 相同的细粒度风险识别能力,具体要求如下:
- 应用场景覆盖
- 模型须支持一般文本内容和 Query & Response 对话两种输入场景,风险分类任务须涵盖通用分类、攻击分类以及安全完成分类,同时须具备多语言风险识别能力。
- 模型的风险分类体系及细粒度风险类别标签必须与 XGuard 官方定义保持一致。
- 标准化输出
- 模型输出须包含细粒度风险类别、细粒度风险置信度以及归因分析三部分。
- 应用场景覆盖
- 加分项:若模型支持“动态策略”,即通过推理时指令添加新的风险类别或调整现有类别的范围或标准,无需重新训练即可适配新兴威胁与业务需求,将依据评审标**准获得额外加分。*
2.提交规则
本次比赛的提交分为初始阶段和进阶阶段:
- 初始阶段,所有选手均需提交模型源文件以及完整的推理代码。
- 进阶阶段,方案被选入官方终评榜的选手需提交额外扩充的数据集(如有)、完整的预处理/训练代码、详细的技术报告。
具体材料要求以及操作流程详见下方“提交说明”。
3.计分规则
评审组将在统一的未公开测试集、硬件与软件环境中对有效提交的模型进行评测。综合得分由“风险识别效果”与“推理运行性能”两大核心维度加权计算得出,并额外计入“动态策略”加分:
- 风险识别效果:使用护栏模型在测试集上的 F1 分数 S_{F1}衡量模型的分类效果。
- 推理运行性能:使用护栏模型在测试集上的风险标注平均耗时 T,即每条样本生成细粒度风险标签所需的平均耗时,量化评估该模型的推理性能。
- 综合得分:所提交模型的总分将被加权计算
Stotal=0.8×SF1+0.2×ToriTori−Tsub+0.15×SDP,SDP=0.8×SF1DP+0.2×ToriDPToriDP−TsubDP
其中,SF1和SF1DP分别为提交模型在通用测试集和“动态策略”测试集上的 F1 分数;Tsub和 TsubDP 分别为提交模型在通用测试集和“动态策略”测试集上的风险标注平均耗时;Tori和 ToriDP 分别为评审组基线版本模型在通用测试集和“动态策略”测试集上的风险标注平均耗时。若模型不支持动态策略,SDP=0。
为确保参赛方案具备实质性的技术进步,选手提交模型的综合得分Stotal必须优于评审组基线版本模型的基准得分。若综合得分未能超越基线,该方案将不予参与该榜单排名与奖金分配。
官方终评榜将依据参赛队伍的综合得分从高到低进行排名。若综合得分相同,将依次按照$ S_{F1}、∗∗T∗∗、S_\text{DP}$的成绩顺次排序。若上述所有客观量化指标均完全一致,则由专家评审组结合方案的技术复杂度与创新性进行综合评估,择优确定最终排名。
榜单每周更新一次。
数据下载
- 本次比赛向选手提供 XGuard 开源训练集(XGuard-Train-Open-200K)以及供选手日常调优与验证参考的公开测试集。
| 数据集 | 获取地址 |
|---|---|
| XGuard-Train-Open-200K | https://huggingface.co/datasets/Alibaba-AAIG/XGuard-Train-Open-200K https://modelscope.cn/datasets/Alibaba-AAIG/XGuard-Train-Open-200K |
| XGuard-Test-Open-1k |
