[v1] support reward training stage (#10431)

Co-authored-by: gemini-code-assist[bot] <176961590+gemini-code-assist[bot]@users.noreply.github.com>
This commit is contained in:
浮梦
2026-05-20 20:46:52 +08:00
committed by GitHub
parent 40e786d016
commit 8b5ea65770
9 changed files with 217 additions and 17 deletions

View File

@@ -53,7 +53,7 @@ class LoggingCallback(TrainerCallback):
return
# Human-readable output to stdout
display_logs = {**logs, "total_steps": state.num_training_steps}
display_logs = {**logs, "step": state.global_step, "total_steps": state.num_training_steps}
parts = ", ".join(f"{k}: {v:.4f}" if isinstance(v, float) else f"{k}: {v}" for k, v in display_logs.items())
logger.info_rank0(parts)