TRAINING DATA / SUPERVISION
看清每一个训练信号。
面向预训练与微调:检查标签、Padding 与拼接边界,定位到具体 token。
BEFORE / AFTER
修复前后发生了什么
全部样本与审计结果
TOKEN INSPECTOR
监督信号地图
参与监督忽略Padding发现问题无法判断
点击一个 token,查看标签、角色与来源证据。
声明的监督标签占比
位移后预测目标:无法计算。
审计按声明的数据契约判断。数量变化提示复核,不推断模型训练效果。
AUDIT FINDINGS
问题与证据
查看 / 编辑输入数据 JSON
当前契约:未提前位移的 causal-LM 标签。标签必须为同位置 token ID 或 -100;角色与来源区间采用左闭右开索引。
JSON 中的 allowed_roles 决定监督范围;JSONL 使用上面的策略。纯文本使用 text 角色。缺少角色或来源映射会显示“需复核”,不会自动补造证据。