Skip to main content
Datasets 提供驱动 evaluation runs 和 training runs 的 prompts 与参考答案或按行的 metadata。每一行都会成为 rollout 和 Grader 处理的一个样本。

Dataset 格式

Osmosis 接受 JSONLCSVParquet 格式的数据集,单个上传文件最大 5 GiB。对于 Parquet 数据集,上传文件和未压缩数据都不得超过 5 GiB 每个数据集至少需要 4 行

Schema 模式

一个数据集必须整份使用同一个 schema。osmosis dataset uploadosmosis dataset validate 会根据存在的列自动选择模式,并对每一行执行相同的校验。 system_prompt 在两种模式下都是可选的。列名区分大小写。
这是与先前版本相比的破坏性变更。省略 ground_truth 的 prompt 模式数据集,以及 metadata 值为 null、空白、缺失或空对象的 metadata 模式数据集,都将不再通过校验。

允许附加其他列。对于 JSONL,每一行的顶层字段集合必须与第一行完全一致。CSV 表头与 Parquet schema 本身就固定了单一列集合。

Metadata 校验规则

Metadata 模式下会校验每一行(不是抽样):
  • 每个单元必须是非空的 JSON 对象。CSV 单元和 JSONL 字符串会被解析为 JSON。Parquet 接受 struct 列或 JSON 对象字符串列。
  • null、空字符串、{} 以及嵌套的空对象都会导致校验失败。
  • 同一 key 在不同行的值类型必须一致。例如 metadata.tag 不能在一行为字符串、另一行为数字。
  • 整数值必须在 64 位有符号整数范围内。

示例:Prompt 模式(JSONL)

示例:Metadata 模式(JSONL)

Metadata 模式的行可以省略所有 prompt 字段:

上传 Dataset

上传后的数据集名称来自文件 stem(本例中是 train)。在 Platform 上传对话框中,如果文件 stem 与现有数据集相同,该文件会标记为 Overwrites existing。完成上传后,现有数据集会被替换。数据集正在上传或处理,或正被 active training run 使用时,不能替换该数据集。 上传后,数据集会进入处理 pipeline。您可以查看状态:

本地验证

上传前先在本地验证数据集,尽早发现格式问题:
这会检查必需列、文件格式和基础 JSONL/CSV/Parquet 结构,不会上传到平台。

预览 Dataset

预览已上传数据集的前几行:

管理 Datasets

在 Platform 的 Datasets 页面中,可以通过数据集的操作菜单:
  • 重命名数据集。
  • 取消正在上传或处理的数据集。
  • 下载数据集文件。
  • 删除数据集。正被 active training run 使用的数据集不能删除。
删除的数据集及其数据会保留 30 天,之后永久删除。

下一步

训练任务

在 training configs 中使用已验证的数据集。

评估任务

使用已上传数据集中的样本评估 rollout。
最后修改于 2026年8月10日