概念
Training Configuration 与 Training Run
Training Configuration 是配方,用于指定 model、dataset、AgentWorkflow 和训练控制项。Training Run 是该配置的一次执行。再次提交该配置即可运行另一个实验。训练集与验证集划分
Osmosis 会打乱所选数据集,并留出约 20% 的行用于验证。验证行数会向下取整,并以 10,000 行为上限,因此更大的数据集会保留超过 80% 用于训练。此划分不可配置。提交训练任务
使用 TOML 配置文件提交训练任务:关键配置字段
branch 与 commit_sha 互斥。设置 branch 时,Osmosis 会在提交时解析一次 branch head,并把完整 commit SHA 存到 run 上。两个字段都省略时使用仓库默认分支。
完整 TOML 参考请参见 Config Files。提交时会针对共享 schema 校验配置,并拒绝未知字段和超出范围的值;它不会针对所选 model 或 backend 校验配置,因此不受支持的组合可能在 provisioning 或执行期间才暴露出来。
状态生命周期
failed 或 crashed 任务仍可能有结束前保存的 checkpoints。单个 rollout 失败不一定会导致整个任务失败:失败的 samples 会被排除在训练更新之外。请使用 Rollout Samples 查看 sample 结果,并用 Logs 诊断重复发生或影响整个任务的故障。监控
平台控制台
在 platform.osmosis.ai 打开 Training Runs,可以按 status、dataset、base model 和 rollout 搜索和筛选任务。列表还支持在对应操作可用时打开、重命名、停止和删除任务。 每个任务页面的侧栏显示 status、rollout-step progress、duration、examples processed、提交与时间详情、dataset、base model 和 rollout。页面包含以下标签页:- Overview:六张图表,分别为 Training Reward、Validation Reward、Model Entropy、Response Length、Total Length 和 Truncation Ratio。对应 metric 可用时图表才会显示,并且可以刷新或下载为 CSV。
- Rollout Samples:按 rollout step 浏览 samples、搜索、比较 reward distribution,并查看每个 sample 的 input 和 output。排查单个 rollout 失败时应先查看这里。
- Checkpoints:绘制 training reward 与已保存 checkpoint steps 的关系,并列出每个 checkpoint 的 name、step 和 reward。您可以重命名 checkpoint、下载 artifacts、打开其 model 页面,并在 inference deployment 可用时进行部署或取消部署。
- Configuration:查看该任务的 rollout、entrypoint、model、dataset、固定的 branch 或 commit、已解析的 secret scopes、environment keys 和保存的 training config。
- Logs:跟踪从提交到完成或清理的 lifecycle events 与诊断信息,并在需要时下载。
CLI 命令
train info 会显示进度(current_step / total_steps)和最新 reward。train list 也会展示相同字段,便于一览所有 runs。
LoRA Checkpoints
当所选 model 和 training backend 支持 LoRA checkpoints 时,Osmosis 会按配置的 rollout-step cadence 保存它们。Checkpoint 捕获训练过程中该时点的 adapter weights;如果任务在首次保存前结束,或所选训练设置不支持 checkpoint,则不保证该任务会产生 checkpoint。管理训练任务
停止任务
stopped;资源清理会继续进行,其进度会显示在该任务的 Logs 中。
下一步
CLI 训练
从 workspace repository 提交并管理 training runs。
数据集
上传训练用数据集。
模型
管理 base models,并部署已训练 LoRA models。