{'loss': '-0.01332', 'grad_norm': '0', 'learning_rate': '4.5e-06', 'num_tokens': '620', 'completions/mean_length': '3', 'completions/min_length': '2.8', 'completions/max_length': '3.2', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '3', 'completions/min_terminated_length': '2.8', 'completions/max_terminated_length': '3.2', 'rewards/reward_fn/mean': '0.45', 'rewards/reward_fn/std': '0.4464', 'reward': '0.45', 'reward_std': '0.4464', 'frac_reward_zero_std': '0.2', 'entropy': '0.5331', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.838', 'epoch': '0.1042'}
{'loss': '-7.947e-09', 'grad_norm': '5.281', 'learning_rate': '3.875e-06', 'num_tokens': '1238', 'completions/mean_length': '2.9', 'completions/min_length': '2.8', 'completions/max_length': '3', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '2.9', 'completions/min_terminated_length': '2.8', 'completions/max_terminated_length': '3', 'rewards/reward_fn/mean': '0.4', 'rewards/reward_fn/std': '0.3155', 'reward': '0.4', 'reward_std': '0.3155', 'frac_reward_zero_std': '0.4', 'entropy': '0.6882', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.917', 'epoch': '0.2083'}
{'loss': '-0.03766', 'grad_norm': '6.562', 'learning_rate': '3.25e-06', 'num_tokens': '1851', 'completions/mean_length': '2.65', 'completions/min_length': '2.2', 'completions/max_length': '3', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '2.65', 'completions/min_terminated_length': '2.2', 'completions/max_terminated_length': '3', 'rewards/reward_fn/mean': '0.55', 'rewards/reward_fn/std': '0.5309', 'reward': '0.55', 'reward_std': '0.5309', 'frac_reward_zero_std': '0', 'entropy': '0.75', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.787', 'epoch': '0.3125'}
{'loss': '-0.06968', 'grad_norm': '9.875', 'learning_rate': '2.625e-06', 'num_tokens': '2465', 'completions/mean_length': '2.7', 'completions/min_length': '2.2', 'completions/max_length': '3', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '2.7', 'completions/min_terminated_length': '2.2', 'completions/max_terminated_length': '3', 'rewards/reward_fn/mean': '0.3', 'rewards/reward_fn/std': '0.4', 'reward': '0.3', 'reward_std': '0.4', 'frac_reward_zero_std': '0.2', 'entropy': '0.6208', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.185', 'epoch': '0.4167'}
{'loss': '-0.05038', 'grad_norm': '10.38', 'learning_rate': '2e-06', 'num_tokens': '3081', 'completions/mean_length': '2.8', 'completions/min_length': '2.4', 'completions/max_length': '3', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '2.8', 'completions/min_terminated_length': '2.4', 'completions/max_terminated_length': '3', 'rewards/reward_fn/mean': '0.3', 'rewards/reward_fn/std': '0.4309', 'reward': '0.3', 'reward_std': '0.4309', 'frac_reward_zero_std': '0.2', 'entropy': '0.6605', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.885', 'epoch': '0.5208'}
{'loss': '-1.987e-09', 'grad_norm': '11', 'learning_rate': '1.375e-06', 'num_tokens': '3699', 'completions/mean_length': '2.9', 'completions/min_length': '2.8', 'completions/max_length': '3', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '2.9', 'completions/min_terminated_length': '2.8', 'completions/max_terminated_length': '3', 'rewards/reward_fn/mean': '0.35', 'rewards/reward_fn/std': '0.2155', 'reward': '0.35', 'reward_std': '0.2155', 'frac_reward_zero_std': '0.6', 'entropy': '0.4328', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '4.186', 'epoch': '0.625'}
{'loss': '0.1373', 'grad_norm': '2.25', 'learning_rate': '7.5e-07', 'num_tokens': '4365', 'completions/mean_length': '5.3', 'completions/min_length': '3', 'completions/max_length': '12', 'completions/clipped_ratio': '0.05', 'completions/mean_terminated_length': '3.067', 'completions/min_terminated_length': '3', 'completions/max_terminated_length': '3.2', 'rewards/reward_fn/mean': '0.55', 'rewards/reward_fn/std': '0.4464', 'reward': '0.55', 'reward_std': '0.4464', 'frac_reward_zero_std': '0.2', 'entropy': '0.7181', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.079', 'epoch': '0.7292'}
{'loss': '0.02307', 'grad_norm': '0', 'learning_rate': '1.25e-07', 'num_tokens': '4986', 'completions/mean_length': '3.05', 'completions/min_length': '3', 'completions/max_length': '3.2', 'completions/clipped_ratio': '0', 'completions/mean_terminated_length': '3.05', 'completions/min_terminated_length': '3', 'completions/max_terminated_length': '3.2', 'rewards/reward_fn/mean': '0.7', 'rewards/reward_fn/std': '0.4', 'reward': '0.7', 'reward_std': '0.4', 'frac_reward_zero_std': '0.2', 'entropy': '0.4484', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '3.402', 'epoch': '0.8333'}
{'train_runtime': '162.2', 'train_samples_per_second': '0.986', 'train_steps_per_second': '0.247', 'train_loss': '-0.001329', 'epoch': '0.8333'}
TRAIN_DONE 2.7 min (4.1 s/step), global_step=40
VRAM pic (training): 1.58 Go