Skip to main content
评估任务会针对 platform dataset 执行您 rollout 的 AgentWorkflowGrader,然后给出汇总分数与每个 sample 的结果。Osmosis 从已同步的 workspace repository 拉取 rollout,并在托管基础设施上运行评估;无需先运行训练任务。

概念

冒烟测试或正式评估

  • 训练前的冒烟测试:使用较小的 [evaluation].limit,在提交训练任务前确认 rollout 能端到端运行,并且 grader 能给出有用的分数。
  • 正式评估:比较 model 或 prompt、跟踪质量随时间的变化,或从 CI 运行检查。将 [evaluation].limit 设为数据集行数即可评估全部行;否则 Osmosis 会随机抽取 10% 的样本。

Evaluation Configuration 与 Evaluation Run

Evaluation Configuration 用于指定 model、dataset、AgentWorkflow 和评估设置。Evaluation Run 是该配置的一次执行。多次提交相同配置可比较随时间发生的变化。

数据集输入模式

在 prompt mode 中,数据集行提供 user_prompt,并通过 ground_truth 或其别名 label 提供参考答案。在 metadata mode 中,每行提供一个 metadata JSON 对象,供 AgentWorkflow 构造任务。Metadata mode 下的 Grader 可以使用 ctx.labelctx.metadata 或两者;请按照所选数据集的 contract 编写 workflow 和 grader。

提交评估任务

提交 configs/eval/ 下的 TOML 配置:
Git Sync 是您 rollout 代码的 source of truth。CLI 会读取您传入的本地 TOML config 值,但 rollout 代码来自已同步的 workspace repository。提交代码修改前,请先 commit 并 push。设置 branch 可使用已 push 的分支,设置 commit_sha 可固定到特定已 push revision;都省略时使用默认分支。
在脚本或 CI 中传入 --yes 可跳过确认提示:

关键配置字段

branchcommit_sha 互斥。设置 branch 时,Osmosis 会在提交时解析一次 branch head,并把完整 commit SHA 存到 run 上。两个字段都省略时使用仓库默认分支。
完整 TOML 参考(包括 [env][secrets])请参见 Config Files
n 表示每个所选数据集行的尝试次数。当 limit = Ln = N 时,Osmosis 最多运行 L * N 次评估;使用采样时为 sampled_rows * n

状态生命周期

监控

平台控制台

platform.osmosis.ai 打开独立的 Evaluation Runs 页面,可以按 status、dataset、model 和 rollout 搜索和筛选任务。每个任务页面的侧栏会在对应值可用时显示 status、sample progress、duration、pass rate、tokens used、提交详情、dataset、model 和 rollout。 任务页面包含四个标签页:
  • Overview:汇总 reward statistics,并在 run 有足够尝试次数时显示 pass@k。
  • Evaluation Samples:可搜索、可筛选的 sample 结果,包含 rewards、workflow messages、ground truth、grader metrics,以及存在时可下载的 artifacts。
  • Configuration:rollout entrypoint、固定的 branch 或 commit、model、dataset、评估设置、已解析的 secret scopes 和 environment keys。
  • Logs:该任务的 lifecycle events 与诊断信息。

CLI 命令

eval info 会在信息可用时显示 run context、timing、progress、configuration 和汇总结果。

管理评估任务

停止任务

这会请求停止 pending 或 running 状态的评估。Cleanup 完成后,run 会进入 stopped 状态。传入 --yes 可跳过确认提示。

下一步

配置文件

评估 TOML config 参考。

数据集

上传并验证 evaluation runs 使用的数据集。

训练任务

评估结果健康后,提交一次训练任务。
最后修改于 2026年8月11日