Dataset 格式
Osmosis 接受 JSONL、CSV 或 Parquet 格式的数据集,单个文件最大 5 GB。 每个数据集至少需要 4 行。必需列
可选列
当您的 Grader 需要参考答案来评分时,请包含
ground_truth(或 label)。如果 reward function 仅基于模型行为评分,则可以省略此列。只包含 metadata(没有 ground_truth)的行仍会进入 Grader。Metadata 校验规则
osmosis dataset upload 与 osmosis dataset validate 会对 CSV、JSONL、Parquet 的 metadata 列执行以下校验:
- 每个单元必须是 JSON 对象(字典)。CSV 单元和 JSONL 字符串会被解析为 JSON;Parquet 接受 struct 列、null 列或 JSON 对象字符串列。
- 嵌套的空对象(顶层对象内出现的
{})会被拒绝。单行的顶层{}允许,但抽样行不能全部为空对象。 - 同一 key 在不同行的值类型必须一致(例如
metadata.tag不能在一行为字符串、另一行为数字)。 - 整数值必须在 64 位有符号整数范围内。
- 空字符串和缺失值视为缺省,会跳过校验。
JSONL 示例
上传 Dataset
train)。上传后,数据集会进入处理 pipeline。您可以查看状态:
本地验证
上传前先在本地验证数据集,尽早发现格式问题:预览 Dataset
预览已上传数据集的前几行:管理 Datasets
下一步
Training Runs
在 training configs 中使用已验证的数据集。
模型
选择 base models,并部署已训练 LoRA models。