Trainer pret. Lancement de l'entrainement...
{'loss': '0.0003113', 'grad_norm': '0.543', 'learning_rate': '4.8e-06', 'num_tokens': '5497', 'completions/mean_length': '46.42', 'completions/min_length': '38.6', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '3.3', 'completions/min_terminated_length': '0.2', 'completions/max_terminated_length': '6.4', 'rewards/reward_fn/mean': '0.1417', 'rewards/reward_fn/std': '0.2523', 'reward': '0.1417', 'reward_std': '0.2523', 'frac_reward_zero_std': '0.3', 'entropy': '1.628', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.431', 'epoch': '0.4167'}
{'loss': '-0.002399', 'grad_norm': '0.4082', 'learning_rate': '4.55e-06', 'num_tokens': '1.099e+04', 'completions/mean_length': '46.55', 'completions/min_length': '40.4', 'completions/max_length': '48', 'completions/clipped_ratio': '0.925', 'completions/mean_terminated_length': '12.5', 'completions/min_terminated_length': '11.6', 'completions/max_terminated_length': '13.4', 'rewards/reward_fn/mean': '0.1', 'rewards/reward_fn/std': '0.1724', 'reward': '0.1', 'reward_std': '0.1724', 'frac_reward_zero_std': '0.3', 'entropy': '1.463', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.733', 'epoch': '0.8333'}
{'loss': '-0.007258', 'grad_norm': '0.4746', 'learning_rate': '4.3e-06', 'num_tokens': '1.652e+04', 'completions/mean_length': '47.35', 'completions/min_length': '42.8', 'completions/max_length': '48', 'completions/clipped_ratio': '0.975', 'completions/mean_terminated_length': '4.4', 'completions/min_terminated_length': '4.4', 'completions/max_terminated_length': '4.4', 'rewards/reward_fn/mean': '0.175', 'rewards/reward_fn/std': '0.271', 'reward': '0.175', 'reward_std': '0.271', 'frac_reward_zero_std': '0.2', 'entropy': '1.969', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '5.891', 'epoch': '1.25'}
{'loss': '-0.01055', 'grad_norm': '0.5938', 'learning_rate': '4.05e-06', 'num_tokens': '2.202e+04', 'completions/mean_length': '46.65', 'completions/min_length': '37.2', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '8.4', 'completions/min_terminated_length': '8.4', 'completions/max_terminated_length': '8.4', 'rewards/reward_fn/mean': '0.1667', 'rewards/reward_fn/std': '0.2601', 'reward': '0.1667', 'reward_std': '0.2601', 'frac_reward_zero_std': '0', 'entropy': '1.64', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '5.679', 'epoch': '1.667'}
{'loss': '0.01967', 'grad_norm': '0.4766', 'learning_rate': '3.8e-06', 'num_tokens': '2.754e+04', 'completions/mean_length': '47.27', 'completions/min_length': '43', 'completions/max_length': '48', 'completions/clipped_ratio': '0.925', 'completions/mean_terminated_length': '14.3', 'completions/min_terminated_length': '14.2', 'completions/max_terminated_length': '14.4', 'rewards/reward_fn/mean': '0.1417', 'rewards/reward_fn/std': '0.2295', 'reward': '0.1417', 'reward_std': '0.2295', 'frac_reward_zero_std': '0.1', 'entropy': '1.472', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.263', 'epoch': '2.083'}
{'loss': '-0.02448', 'grad_norm': '0.6055', 'learning_rate': '3.55e-06', 'num_tokens': '3.3e+04', 'completions/mean_length': '45.65', 'completions/min_length': '29.2', 'completions/max_length': '48', 'completions/clipped_ratio': '0.925', 'completions/mean_terminated_length': '10', 'completions/min_terminated_length': '10', 'completions/max_terminated_length': '10', 'rewards/reward_fn/mean': '0.1083', 'rewards/reward_fn/std': '0.1815', 'reward': '0.1083', 'reward_std': '0.1815', 'frac_reward_zero_std': '0.5', 'entropy': '1.517', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '5.697', 'epoch': '2.5'}
{'loss': '-0.01098', 'grad_norm': '0.5664', 'learning_rate': '3.3e-06', 'num_tokens': '3.846e+04', 'completions/mean_length': '45.67', 'completions/min_length': '29.8', 'completions/max_length': '48', 'completions/clipped_ratio': '0.9', 'completions/mean_terminated_length': '15.1', 'completions/min_terminated_length': '10.6', 'completions/max_terminated_length': '19.6', 'rewards/reward_fn/mean': '0.1667', 'rewards/reward_fn/std': '0.2824', 'reward': '0.1667', 'reward_std': '0.2824', 'frac_reward_zero_std': '0.2', 'entropy': '1.746', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.021', 'epoch': '2.917'}
{'loss': '0.02177', 'grad_norm': '0', 'learning_rate': '3.05e-06', 'num_tokens': '4.398e+04', 'completions/mean_length': '47.35', 'completions/min_length': '42.8', 'completions/max_length': '48', 'completions/clipped_ratio': '0.975', 'completions/mean_terminated_length': '4.4', 'completions/min_terminated_length': '4.4', 'completions/max_terminated_length': '4.4', 'rewards/reward_fn/mean': '0.1167', 'rewards/reward_fn/std': '0.1772', 'reward': '0.1167', 'reward_std': '0.1772', 'frac_reward_zero_std': '0.3', 'entropy': '1.529', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.477', 'epoch': '3.333'}
{'loss': '-0.00696', 'grad_norm': '0.5078', 'learning_rate': '2.8e-06', 'num_tokens': '4.947e+04', 'completions/mean_length': '46.3', 'completions/min_length': '34.4', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '5.6', 'completions/min_terminated_length': '5.6', 'completions/max_terminated_length': '5.6', 'rewards/reward_fn/mean': '0.1333', 'rewards/reward_fn/std': '0.2373', 'reward': '0.1333', 'reward_std': '0.2373', 'frac_reward_zero_std': '0.3', 'entropy': '1.557', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.251', 'epoch': '3.75'}
{'loss': '0.02592', 'grad_norm': '0.252', 'learning_rate': '2.55e-06', 'num_tokens': '5.493e+04', 'completions/mean_length': '45.02', 'completions/min_length': '29.2', 'completions/max_length': '48', 'completions/clipped_ratio': '0.9', 'completions/mean_terminated_length': '10.1', 'completions/min_terminated_length': '10', 'completions/max_terminated_length': '10.2', 'rewards/reward_fn/mean': '0.1333', 'rewards/reward_fn/std': '0.2049', 'reward': '0.1333', 'reward_std': '0.2049', 'frac_reward_zero_std': '0.2', 'entropy': '1.534', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '5.623', 'epoch': '4.167'}
{'loss': '0.01818', 'grad_norm': '0.5234', 'learning_rate': '2.3e-06', 'num_tokens': '6.044e+04', 'completions/mean_length': '47', 'completions/min_length': '40', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '11.2', 'completions/min_terminated_length': '11.2', 'completions/max_terminated_length': '11.2', 'rewards/reward_fn/mean': '0.1167', 'rewards/reward_fn/std': '0.1948', 'reward': '0.1167', 'reward_std': '0.1948', 'frac_reward_zero_std': '0.2', 'entropy': '1.55', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.204', 'epoch': '4.583'}
{'loss': '-0.01832', 'grad_norm': '0.3281', 'learning_rate': '2.05e-06', 'num_tokens': '6.592e+04', 'completions/mean_length': '46.25', 'completions/min_length': '34', 'completions/max_length': '48', 'completions/clipped_ratio': '0.925', 'completions/mean_terminated_length': '14.8', 'completions/min_terminated_length': '14.8', 'completions/max_terminated_length': '14.8', 'rewards/reward_fn/mean': '0.1833', 'rewards/reward_fn/std': '0.2626', 'reward': '0.1833', 'reward_std': '0.2626', 'frac_reward_zero_std': '0.2', 'entropy': '1.641', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.134', 'epoch': '5'}
{'loss': '-0.04269', 'grad_norm': '0.4277', 'learning_rate': '1.8e-06', 'num_tokens': '7.136e+04', 'completions/mean_length': '45.12', 'completions/min_length': '25', 'completions/max_length': '48', 'completions/clipped_ratio': '0.925', 'completions/mean_terminated_length': '5.8', 'completions/min_terminated_length': '5.8', 'completions/max_terminated_length': '5.8', 'rewards/reward_fn/mean': '0.08333', 'rewards/reward_fn/std': '0.1755', 'reward': '0.08333', 'reward_std': '0.1755', 'frac_reward_zero_std': '0.3', 'entropy': '1.745', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.899', 'epoch': '5.417'}
{'loss': '-0.029', 'grad_norm': '0.3496', 'learning_rate': '1.55e-06', 'num_tokens': '7.68e+04', 'completions/mean_length': '45.08', 'completions/min_length': '29.4', 'completions/max_length': '48', 'completions/clipped_ratio': '0.9', 'completions/mean_terminated_length': '10.8', 'completions/min_terminated_length': '10.2', 'completions/max_terminated_length': '11.4', 'rewards/reward_fn/mean': '0.05', 'rewards/reward_fn/std': '0.1089', 'reward': '0.05', 'reward_std': '0.1089', 'frac_reward_zero_std': '0.5', 'entropy': '1.7', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.838', 'epoch': '5.833'}
{'loss': '-0.03454', 'grad_norm': '0.4375', 'learning_rate': '1.3e-06', 'num_tokens': '8.229e+04', 'completions/mean_length': '46.62', 'completions/min_length': '37', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '8.2', 'completions/min_terminated_length': '8.2', 'completions/max_terminated_length': '8.2', 'rewards/reward_fn/mean': '0.1333', 'rewards/reward_fn/std': '0.1996', 'reward': '0.1333', 'reward_std': '0.1996', 'frac_reward_zero_std': '0.2', 'entropy': '1.571', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.745', 'epoch': '6.25'}
{'loss': '-0.003783', 'grad_norm': '0.416', 'learning_rate': '1.05e-06', 'num_tokens': '8.78e+04', 'completions/mean_length': '47.1', 'completions/min_length': '40.8', 'completions/max_length': '48', 'completions/clipped_ratio': '0.95', 'completions/mean_terminated_length': '12', 'completions/min_terminated_length': '12', 'completions/max_terminated_length': '12', 'rewards/reward_fn/mean': '0.125', 'rewards/reward_fn/std': '0.2087', 'reward': '0.125', 'reward_std': '0.2087', 'frac_reward_zero_std': '0.2', 'entropy': '1.745', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '7.626', 'epoch': '6.667'}
{'loss': '-0.002947', 'grad_norm': '0', 'learning_rate': '8e-07', 'num_tokens': '9.335e+04', 'completions/mean_length': '47.25', 'completions/min_length': '42', 'completions/max_length': '48', 'completions/clipped_ratio': '0.9', 'completions/mean_terminated_length': '16.2', 'completions/min_terminated_length': '13.2', 'completions/max_terminated_length': '19.2', 'rewards/reward_fn/mean': '0.05833', 'rewards/reward_fn/std': '0.1162', 'reward': '0.05833', 'reward_std': '0.1162', 'frac_reward_zero_std': '0.5', 'entropy': '1.778', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '5.986', 'epoch': '7.083'}
{'loss': '0.02004', 'grad_norm': '0.5625', 'learning_rate': '5.5e-07', 'num_tokens': '9.881e+04', 'completions/mean_length': '45.75', 'completions/min_length': '35.2', 'completions/max_length': '48', 'completions/clipped_ratio': '0.9', 'completions/mean_terminated_length': '16.9', 'completions/min_terminated_length': '16', 'completions/max_terminated_length': '17.8', 'rewards/reward_fn/mean': '0.1167', 'rewards/reward_fn/std': '0.1875', 'reward': '0.1167', 'reward_std': '0.1875', 'frac_reward_zero_std': '0.2', 'entropy': '1.786', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.651', 'epoch': '7.5'}
{'loss': '-0.009518', 'grad_norm': '0.5312', 'learning_rate': '3e-07', 'num_tokens': '1.043e+05', 'completions/mean_length': '47.45', 'completions/min_length': '43.6', 'completions/max_length': '48', 'completions/clipped_ratio': '0.975', 'completions/mean_terminated_length': '5.2', 'completions/min_terminated_length': '5.2', 'completions/max_terminated_length': '5.2', 'rewards/reward_fn/mean': '0.1667', 'rewards/reward_fn/std': '0.2684', 'reward': '0.1667', 'reward_std': '0.2684', 'frac_reward_zero_std': '0.3', 'entropy': '1.448', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.676', 'epoch': '7.917'}
{'loss': '1.142e-08', 'grad_norm': '0.6016', 'learning_rate': '5e-08', 'num_tokens': '1.099e+05', 'completions/mean_length': '47.38', 'completions/min_length': '43', 'completions/max_length': '48', 'completions/clipped_ratio': '0.975', 'completions/mean_terminated_length': '4.6', 'completions/min_terminated_length': '4.6', 'completions/max_terminated_length': '4.6', 'rewards/reward_fn/mean': '0.1083', 'rewards/reward_fn/std': '0.1749', 'reward': '0.1083', 'reward_std': '0.1749', 'frac_reward_zero_std': '0.4', 'entropy': '1.784', 'clip_ratio/low_mean': '0', 'clip_ratio/high_mean': '0', 'clip_ratio/region_mean': '0', 'clip_ratio/low_min': '0', 'clip_ratio/high_max': '0', 'step_time': '6.387', 'epoch': '8.333'}
{'train_runtime': '636.7', 'train_samples_per_second': '1.256', 'train_steps_per_second': '0.157', 'train_loss': '-0.004876', 'epoch': '8.333'}
TRAIN_DONE en 10.6 min. global_step=100
reward finale (moyenne mobile): 0.0