Dataset 格式
Osmosis 接受 JSONL、CSV 或 Parquet 格式的数据集,单个上传文件最大 5 GiB。对于 Parquet 数据集,上传文件和未压缩数据都不得超过 5 GiB。 每个数据集至少需要 4 行。Schema 模式
一个数据集必须整份使用同一个 schema。osmosis dataset upload 与 osmosis dataset validate 会根据存在的列自动选择模式,并对每一行执行相同的校验。
system_prompt 在两种模式下都是可选的。列名区分大小写。
这是与先前版本相比的破坏性变更。省略
ground_truth 的 prompt 模式数据集,以及 metadata 值为 null、空白、缺失或空对象的 metadata 模式数据集,都将不再通过校验。列
允许附加其他列。对于 JSONL,每一行的顶层字段集合必须与第一行完全一致。CSV 表头与 Parquet schema 本身就固定了单一列集合。
Metadata 校验规则
Metadata 模式下会校验每一行(不是抽样):- 每个单元必须是非空的 JSON 对象。CSV 单元和 JSONL 字符串会被解析为 JSON。Parquet 接受 struct 列或 JSON 对象字符串列。
null、空字符串、{}以及嵌套的空对象都会导致校验失败。- 同一 key 在不同行的值类型必须一致。例如
metadata.tag不能在一行为字符串、另一行为数字。 - 整数值必须在 64 位有符号整数范围内。
示例:Prompt 模式(JSONL)
示例:Metadata 模式(JSONL)
Metadata 模式的行可以省略所有 prompt 字段:上传 Dataset
train)。在 Platform 上传对话框中,如果文件 stem 与现有数据集相同,该文件会标记为 Overwrites existing。完成上传后,现有数据集会被替换。数据集正在上传或处理,或正被 active training run 使用时,不能替换该数据集。
上传后,数据集会进入处理 pipeline。您可以查看状态:
本地验证
上传前先在本地验证数据集,尽早发现格式问题:预览 Dataset
预览已上传数据集的前几行:管理 Datasets
- 重命名数据集。
- 取消正在上传或处理的数据集。
- 下载数据集文件。
- 删除数据集。正被 active training run 使用的数据集不能删除。
下一步
训练任务
在 training configs 中使用已验证的数据集。
评估任务
使用已上传数据集中的样本评估 rollout。