AgentWorkflow 和 Grader,然后给出汇总分数与每个 sample 的结果。Platform 中可见的 runs 可以来自 eval submit 后的 managed execution,也可以来自通过 --upload 或 eval upload 发布的已完成本地 eval run。
概念
冒烟测试或正式评估
- 本地冒烟测试:使用
osmosis eval run和较小的[evaluation].limit,确认 rollout 能端到端运行,并且 grader 能给出有用的分数。 - 训练前的 managed 正式评估:使用
osmosis eval submit,并将[evaluation].limit设为数据集行数以评估全部行;否则 Osmosis 会随机抽取 10% 的样本。上传的本地结果不能替代该 managed full-size gate。
Evaluation Configuration 与 Evaluation Run
Evaluation Configuration 用于指定 model、dataset、AgentWorkflow 和评估设置。Evaluation Run 是该配置的一次执行。多次提交相同配置可比较随时间发生的变化。数据集输入模式
在 prompt mode 中,数据集行提供user_prompt,并通过 ground_truth 或其别名 label 提供参考答案。在 metadata mode 中,每行提供一个 metadata JSON 对象,供 AgentWorkflow 构造任务。Metadata mode 下的 Grader 可以使用 ctx.label、ctx.metadata 或两者;请按照所选数据集的 contract 编写 workflow 和 grader。
发布本地 Run
通过 rollout 的LocalBackend 或 Harbor Docker backend 在本地运行,并在完成后发布:
eval upload 不需要 confirmation,也没有额外 flags。它需要已认证的 workspace context,以及包含 manifest.json、index.jsonl、progress.json 和 metrics.json 的兼容 completed directory。Pending 和 cancelled runs 不能上传;failed 和 skipped samples 属于 terminal 状态,可以上传。
发布是 idempotent 且以 server 为准。中断后再次运行同一命令会返回相同的 platform run,并仅上传缺失的 server 文件。CLI 会将 logs.txt 保留在本地;Osmosis 会严格校验允许的 trajectories 与 artifacts,并重新计算 metrics,而不会启动 hosted 或 Temporal evaluation work。
提交 Managed Evaluation Run
提交configs/eval/ 下的 TOML 配置:
--yes 可跳过确认提示:
关键配置字段
branch 与 commit_sha 互斥。设置 branch 时,Osmosis 会在提交时解析一次 branch head,并把完整 commit SHA 存到 run 上。两个字段都省略时使用仓库默认分支。
完整 TOML 参考(包括
[env] 和 [secrets])请参见 Config Files。n 表示每个所选数据集行的尝试次数。当 limit = L、n = N 时,Osmosis 最多运行 L * N 次评估;使用采样时为 sampled_rows * n。状态生命周期
监控
平台控制台
在 platform.osmosis.ai 打开独立的 Evaluation Runs 页面,可以按 status、dataset、model 和 rollout 搜索和筛选任务。上传的本地结果带有 Local badge,dirty Git provenance 会显示 warning。每个任务页面的侧栏会在对应值可用时显示 status、sample progress、duration、pass rate、tokens used、提交详情、dataset、model 和 rollout。 任务页面包含四个标签页:- Overview:汇总 reward statistics,并在 run 有足够尝试次数时显示 pass@k。
- Evaluation Samples:可搜索、可筛选的 sample 结果,包含 rewards、workflow messages、ground truth、grader metrics,以及存在时可下载的 artifacts。
- Configuration:rollout entrypoint、固定的 branch 或 commit、model、dataset、评估设置、已解析的 secret scopes 和 environment keys。
- Logs:该任务的 lifecycle events 与诊断信息。
CLI 命令
eval info 会在信息可用时显示 run context、timing、progress、configuration 和汇总结果。
管理评估任务
停止任务
stopped 状态。传入 --yes 可跳过确认提示。
下一步
配置文件
评估 TOML config 参考。
数据集
上传并验证 evaluation runs 使用的数据集。
训练任务
Managed full-size evaluation gate 通过后,提交一次训练任务。