Skip to main content
训练任务通过强化学习改进 base model。您提供 rollout、grader、训练 config 和数据集;Osmosis 在托管的训练基础设施上运行任务,从已同步的 workspace repository 拉取代码,并记录 metrics、samples、logs 以及该任务产生的 checkpoints。

概念

Training Configuration 与 Training Run

Training Configuration 是配方,用于指定 model、dataset、AgentWorkflow 和训练控制项。Training Run 是该配置的一次执行。再次提交该配置即可运行另一个实验。

训练集与验证集划分

Osmosis 会打乱所选数据集,并留出约 20% 的行用于验证。验证行数会向下取整,并以 10,000 行为上限,因此更大的数据集会保留超过 80% 用于训练。此划分不可配置。

提交训练任务

使用 TOML 配置文件提交训练任务:
Git Sync 是您 rollout 代码的 source of truth。CLI 会读取您传入的本地 TOML config 值,但 rollout 代码来自已同步的 workspace repository。提交代码修改前,请先 commit 并 push。设置 branch 可使用已 push 的分支,设置 commit_sha 可固定到特定已 push revision;都省略时使用默认分支。

关键配置字段

branchcommit_sha 互斥。设置 branch 时,Osmosis 会在提交时解析一次 branch head,并把完整 commit SHA 存到 run 上。两个字段都省略时使用仓库默认分支。
完整 TOML 参考请参见 Config Files。提交时会针对共享 schema 校验配置,并拒绝未知字段和超出范围的值;它不会针对所选 model 或 backend 校验配置,因此不受支持的组合可能在 provisioning 或执行期间才暴露出来。

状态生命周期

failedcrashed 任务仍可能有结束前保存的 checkpoints。单个 rollout 失败不一定会导致整个任务失败:失败的 samples 会被排除在训练更新之外。请使用 Rollout Samples 查看 sample 结果,并用 Logs 诊断重复发生或影响整个任务的故障。

监控

平台控制台

platform.osmosis.ai 打开 Training Runs,可以按 status、dataset、base model 和 rollout 搜索和筛选任务。列表还支持在对应操作可用时打开、重命名、停止和删除任务。 每个任务页面的侧栏显示 status、rollout-step progress、duration、examples processed、提交与时间详情、dataset、base model 和 rollout。页面包含以下标签页:
  • Overview:六张图表,分别为 Training Reward、Validation Reward、Model Entropy、Response Length、Total Length 和 Truncation Ratio。对应 metric 可用时图表才会显示,并且可以刷新或下载为 CSV。
  • Rollout Samples:按 rollout step 浏览 samples、搜索、比较 reward distribution,并查看每个 sample 的 input 和 output。排查单个 rollout 失败时应先查看这里。
  • Checkpoints:绘制 training reward 与已保存 checkpoint steps 的关系,并列出每个 checkpoint 的 name、step 和 reward。您可以重命名 checkpoint、下载 artifacts、打开其 model 页面,并在 inference deployment 可用时进行部署或取消部署。
  • Configuration:查看该任务的 rollout、entrypoint、model、dataset、固定的 branch 或 commit、已解析的 secret scopes、environment keys 和保存的 training config。
  • Logs:跟踪从提交到完成或清理的 lifecycle events 与诊断信息,并在需要时下载。

CLI 命令

任务运行时,train info 会显示进度(current_step / total_steps)和最新 reward。train list 也会展示相同字段,便于一览所有 runs。

LoRA Checkpoints

当所选 model 和 training backend 支持 LoRA checkpoints 时,Osmosis 会按配置的 rollout-step cadence 保存它们。Checkpoint 捕获训练过程中该时点的 adapter weights;如果任务在首次保存前结束,或所选训练设置不支持 checkpoint,则不保证该任务会产生 checkpoint。

管理训练任务

停止任务

这会请求优雅停止。平台接受取消请求后,任务立即标记为 stopped;资源清理会继续进行,其进度会显示在该任务的 Logs 中。

下一步

CLI 训练

从 workspace repository 提交并管理 training runs。

数据集

上传训练用数据集。

模型

管理 base models,并部署已训练 LoRA models。
最后修改于 2026年8月11日