diff --git "a/trainer_state.json" "b/trainer_state.json" new file mode 100644--- /dev/null +++ "b/trainer_state.json" @@ -0,0 +1,2967 @@ +{ + "best_metric": null, + "best_model_checkpoint": null, + "epoch": 0.5599626691553896, + "eval_steps": 500, + "global_step": 450, + "is_hyper_param_search": false, + "is_local_process_zero": true, + "is_world_process_zero": true, + "log_history": [ + { + "completion_length": 503.56141090393066, + "epoch": 0.002488722974023954, + "grad_norm": 0.0948848358664139, + "kl": 0.0, + "learning_rate": 7.142857142857142e-08, + "loss": -0.0, + "reward": 0.302455373108387, + "reward_std": 0.4470902141183615, + "rewards/equation_reward_func": 0.05691964563447982, + "rewards/format_reward_func": 0.24553572107106447, + "step": 2 + }, + { + "completion_length": 496.7712287902832, + "epoch": 0.004977445948047908, + "grad_norm": 0.11039430968253656, + "kl": 0.0003851652145385742, + "learning_rate": 1.4285714285714285e-07, + "loss": 0.0, + "reward": 0.313616088591516, + "reward_std": 0.4562107492238283, + "rewards/equation_reward_func": 0.051339288242161274, + "rewards/format_reward_func": 0.26227679569274187, + "step": 4 + }, + { + "completion_length": 484.37056159973145, + "epoch": 0.007466168922071862, + "grad_norm": 0.09700064038560771, + "kl": 0.0003807544708251953, + "learning_rate": 2.1428571428571426e-07, + "loss": 0.0, + "reward": 0.31026787031441927, + "reward_std": 0.4778581503778696, + "rewards/equation_reward_func": 0.04464285960420966, + "rewards/format_reward_func": 0.2656250102445483, + "step": 6 + }, + { + "completion_length": 491.7064971923828, + "epoch": 0.009954891896095816, + "grad_norm": 0.11222944095605243, + "kl": 0.0003857612609863281, + "learning_rate": 2.857142857142857e-07, + "loss": 0.0, + "reward": 0.3526785857975483, + "reward_std": 0.48208368569612503, + "rewards/equation_reward_func": 0.06138393119908869, + "rewards/format_reward_func": 0.29129465483129025, + "step": 8 + }, + { + "completion_length": 481.55136489868164, + "epoch": 0.01244361487011977, + "grad_norm": 0.10010029385278177, + "kl": 0.0004470348358154297, + "learning_rate": 3.5714285714285716e-07, + "loss": 0.0, + "reward": 0.34933037497103214, + "reward_std": 0.48176000639796257, + "rewards/equation_reward_func": 0.06473214644938707, + "rewards/format_reward_func": 0.28459822945296764, + "step": 10 + }, + { + "completion_length": 482.3136405944824, + "epoch": 0.014932337844143724, + "grad_norm": 0.10991646335937744, + "kl": 0.0005280971527099609, + "learning_rate": 4.285714285714285e-07, + "loss": 0.0, + "reward": 0.36160716600716114, + "reward_std": 0.4869873467832804, + "rewards/equation_reward_func": 0.05245535890571773, + "rewards/format_reward_func": 0.3091518050059676, + "step": 12 + }, + { + "completion_length": 474.49109268188477, + "epoch": 0.017421060818167678, + "grad_norm": 0.09629390166600237, + "kl": 0.0010502338409423828, + "learning_rate": 5e-07, + "loss": 0.0, + "reward": 0.483258955180645, + "reward_std": 0.5381666142493486, + "rewards/equation_reward_func": 0.06250000209547579, + "rewards/format_reward_func": 0.4207589514553547, + "step": 14 + }, + { + "completion_length": 461.3962230682373, + "epoch": 0.019909783792191632, + "grad_norm": 0.10141033715590766, + "kl": 0.0015168190002441406, + "learning_rate": 4.999740409224932e-07, + "loss": 0.0, + "reward": 0.5424107331782579, + "reward_std": 0.5326656997203827, + "rewards/equation_reward_func": 0.058035717345774174, + "rewards/format_reward_func": 0.4843750186264515, + "step": 16 + }, + { + "completion_length": 460.481050491333, + "epoch": 0.022398506766215586, + "grad_norm": 0.07526369827636718, + "kl": 0.005082130432128906, + "learning_rate": 4.998961690809627e-07, + "loss": 0.0, + "reward": 0.7901786044239998, + "reward_std": 0.5360442269593477, + "rewards/equation_reward_func": 0.08035714610014111, + "rewards/format_reward_func": 0.709821455180645, + "step": 18 + }, + { + "completion_length": 452.7879695892334, + "epoch": 0.02488722974023954, + "grad_norm": 0.07040025423308008, + "kl": 0.00662994384765625, + "learning_rate": 4.997664006472578e-07, + "loss": 0.0, + "reward": 0.8392857536673546, + "reward_std": 0.497211379930377, + "rewards/equation_reward_func": 0.08928571699652821, + "rewards/format_reward_func": 0.7500000447034836, + "step": 20 + }, + { + "completion_length": 457.1462287902832, + "epoch": 0.027375952714263494, + "grad_norm": 0.0706145552092105, + "kl": 0.0069255828857421875, + "learning_rate": 4.995847625707292e-07, + "loss": 0.0, + "reward": 0.8738839700818062, + "reward_std": 0.4637769144028425, + "rewards/equation_reward_func": 0.08928571839351207, + "rewards/format_reward_func": 0.7845982611179352, + "step": 22 + }, + { + "completion_length": 440.41743087768555, + "epoch": 0.029864675688287448, + "grad_norm": 0.06311767376346097, + "kl": 0.0074863433837890625, + "learning_rate": 4.993512925726318e-07, + "loss": 0.0, + "reward": 0.9408482499420643, + "reward_std": 0.423699701204896, + "rewards/equation_reward_func": 0.09486607497092336, + "rewards/format_reward_func": 0.8459821790456772, + "step": 24 + }, + { + "completion_length": 469.8939914703369, + "epoch": 0.0323533986623114, + "grad_norm": 0.062583919157641, + "kl": 0.008693695068359375, + "learning_rate": 4.990660391382923e-07, + "loss": 0.0, + "reward": 0.9553571902215481, + "reward_std": 0.43422539345920086, + "rewards/equation_reward_func": 0.10044643352739513, + "rewards/format_reward_func": 0.8549107573926449, + "step": 26 + }, + { + "completion_length": 443.16185188293457, + "epoch": 0.034842121636335356, + "grad_norm": 0.06052609584603851, + "kl": 0.0123748779296875, + "learning_rate": 4.987290615070384e-07, + "loss": 0.0, + "reward": 1.041294701397419, + "reward_std": 0.3484124131500721, + "rewards/equation_reward_func": 0.12053572025615722, + "rewards/format_reward_func": 0.9207589663565159, + "step": 28 + }, + { + "completion_length": 423.43640327453613, + "epoch": 0.03733084461035931, + "grad_norm": 0.06438768655706453, + "kl": 0.037322998046875, + "learning_rate": 4.983404296598978e-07, + "loss": 0.0, + "reward": 1.0691964775323868, + "reward_std": 0.3513711765408516, + "rewards/equation_reward_func": 0.137276794295758, + "rewards/format_reward_func": 0.9319196827709675, + "step": 30 + }, + { + "completion_length": 430.5067195892334, + "epoch": 0.039819567584383264, + "grad_norm": 0.058402210713399266, + "kl": 0.016407012939453125, + "learning_rate": 4.979002243050646e-07, + "loss": 0.0, + "reward": 1.0636161379516125, + "reward_std": 0.3065283698961139, + "rewards/equation_reward_func": 0.11718750465661287, + "rewards/format_reward_func": 0.9464286081492901, + "step": 32 + }, + { + "completion_length": 406.2924289703369, + "epoch": 0.042308290558407215, + "grad_norm": 0.05357769148482046, + "kl": 0.018497467041015625, + "learning_rate": 4.974085368611381e-07, + "loss": 0.0, + "reward": 1.072544701397419, + "reward_std": 0.26174191664904356, + "rewards/equation_reward_func": 0.10937500570435077, + "rewards/format_reward_func": 0.9631696678698063, + "step": 34 + }, + { + "completion_length": 396.38394927978516, + "epoch": 0.04479701353243117, + "grad_norm": 0.052051460097072955, + "kl": 0.018001556396484375, + "learning_rate": 4.968654694381379e-07, + "loss": 0.0, + "reward": 1.0792411267757416, + "reward_std": 0.264671778306365, + "rewards/equation_reward_func": 0.11495536263100803, + "rewards/format_reward_func": 0.9642857499420643, + "step": 36 + }, + { + "completion_length": 377.9855155944824, + "epoch": 0.04728573650645512, + "grad_norm": 0.04517660218693028, + "kl": 0.02022552490234375, + "learning_rate": 4.962711348162987e-07, + "loss": 0.0, + "reward": 1.09933041036129, + "reward_std": 0.24636342655867338, + "rewards/equation_reward_func": 0.12388393352739513, + "rewards/format_reward_func": 0.9754464626312256, + "step": 38 + }, + { + "completion_length": 379.65738105773926, + "epoch": 0.04977445948047908, + "grad_norm": 0.05744479093406108, + "kl": 0.02159881591796875, + "learning_rate": 4.956256564226487e-07, + "loss": 0.0, + "reward": 1.0781250521540642, + "reward_std": 0.25441541336476803, + "rewards/equation_reward_func": 0.10825893341097981, + "rewards/format_reward_func": 0.9698661044239998, + "step": 40 + }, + { + "completion_length": 374.02791595458984, + "epoch": 0.05226318245450303, + "grad_norm": 0.058753380813439324, + "kl": 0.0220794677734375, + "learning_rate": 4.949291683053768e-07, + "loss": 0.0, + "reward": 1.1138393431901932, + "reward_std": 0.2881670519709587, + "rewards/equation_reward_func": 0.14285714994184673, + "rewards/format_reward_func": 0.9709821678698063, + "step": 42 + }, + { + "completion_length": 376.6361789703369, + "epoch": 0.05475190542852699, + "grad_norm": 0.04253532297873144, + "kl": 0.02449798583984375, + "learning_rate": 4.941818151059955e-07, + "loss": 0.0, + "reward": 1.0915179252624512, + "reward_std": 0.2087155058979988, + "rewards/equation_reward_func": 0.11272321897558868, + "rewards/format_reward_func": 0.9787946715950966, + "step": 44 + }, + { + "completion_length": 372.0290336608887, + "epoch": 0.05724062840255094, + "grad_norm": 0.055294299722758004, + "kl": 0.02376556396484375, + "learning_rate": 4.933837520293017e-07, + "loss": 0.0, + "reward": 1.1004464849829674, + "reward_std": 0.2569141434505582, + "rewards/equation_reward_func": 0.1250000069849193, + "rewards/format_reward_func": 0.9754464700818062, + "step": 46 + }, + { + "completion_length": 357.9397449493408, + "epoch": 0.059729351376574896, + "grad_norm": 0.05485318549956521, + "kl": 0.02727508544921875, + "learning_rate": 4.925351448111454e-07, + "loss": 0.0, + "reward": 1.1361607685685158, + "reward_std": 0.26225551683455706, + "rewards/equation_reward_func": 0.15848215075675398, + "rewards/format_reward_func": 0.9776785969734192, + "step": 48 + }, + { + "completion_length": 344.12947845458984, + "epoch": 0.06221807435059885, + "grad_norm": 0.06195502205989122, + "kl": 0.02738189697265625, + "learning_rate": 4.91636169684011e-07, + "loss": 0.0, + "reward": 1.1763393431901932, + "reward_std": 0.25935907755047083, + "rewards/equation_reward_func": 0.18415179545991123, + "rewards/format_reward_func": 0.9921875223517418, + "step": 50 + }, + { + "completion_length": 364.3404197692871, + "epoch": 0.0647067973246228, + "grad_norm": 0.053362806131777296, + "kl": 0.0282440185546875, + "learning_rate": 4.906870133404186e-07, + "loss": 0.0, + "reward": 1.150669701397419, + "reward_std": 0.2615376366302371, + "rewards/equation_reward_func": 0.16852679406292737, + "rewards/format_reward_func": 0.9821428917348385, + "step": 52 + }, + { + "completion_length": 349.52233695983887, + "epoch": 0.06719552029864675, + "grad_norm": 0.05603847653858231, + "kl": 0.0309600830078125, + "learning_rate": 4.896878728941531e-07, + "loss": 0.0, + "reward": 1.1640625670552254, + "reward_std": 0.25859395135194063, + "rewards/equation_reward_func": 0.1752232222352177, + "rewards/format_reward_func": 0.9888393133878708, + "step": 54 + }, + { + "completion_length": 357.9721164703369, + "epoch": 0.06968424327267071, + "grad_norm": 0.05692788775474882, + "kl": 0.0357513427734375, + "learning_rate": 4.886389558393284e-07, + "loss": 0.0, + "reward": 1.1830357536673546, + "reward_std": 0.29094040393829346, + "rewards/equation_reward_func": 0.19866072107106447, + "rewards/format_reward_func": 0.9843750409781933, + "step": 56 + }, + { + "completion_length": 356.3794803619385, + "epoch": 0.07217296624669467, + "grad_norm": 0.05896567816690595, + "kl": 0.03997802734375, + "learning_rate": 4.875404800072976e-07, + "loss": 0.0, + "reward": 1.1875000521540642, + "reward_std": 0.2795195486396551, + "rewards/equation_reward_func": 0.20200893841683865, + "rewards/format_reward_func": 0.9854910969734192, + "step": 58 + }, + { + "completion_length": 347.1930961608887, + "epoch": 0.07466168922071861, + "grad_norm": 0.050230804578636344, + "kl": 0.039276123046875, + "learning_rate": 4.86392673521415e-07, + "loss": 0.0, + "reward": 1.1830357685685158, + "reward_std": 0.25950881000608206, + "rewards/equation_reward_func": 0.19531250791624188, + "rewards/format_reward_func": 0.9877232350409031, + "step": 60 + }, + { + "completion_length": 337.48215675354004, + "epoch": 0.07715041219474257, + "grad_norm": 0.052408896199406675, + "kl": 0.0442047119140625, + "learning_rate": 4.851957747496606e-07, + "loss": 0.0, + "reward": 1.1841518469154835, + "reward_std": 0.2687631882727146, + "rewards/equation_reward_func": 0.20200893853325397, + "rewards/format_reward_func": 0.9821428805589676, + "step": 62 + }, + { + "completion_length": 345.3080520629883, + "epoch": 0.07963913516876653, + "grad_norm": 0.06294945230632734, + "kl": 0.0493011474609375, + "learning_rate": 4.839500322551386e-07, + "loss": 0.0, + "reward": 1.1986607611179352, + "reward_std": 0.28346721874549985, + "rewards/equation_reward_func": 0.20647322351578623, + "rewards/format_reward_func": 0.9921875223517418, + "step": 64 + }, + { + "completion_length": 350.44755935668945, + "epoch": 0.08212785814279049, + "grad_norm": 0.06086093842006542, + "kl": 0.050140380859375, + "learning_rate": 4.826557047444563e-07, + "loss": 0.0001, + "reward": 1.2064732760190964, + "reward_std": 0.30727679654955864, + "rewards/equation_reward_func": 0.22209822852164507, + "rewards/format_reward_func": 0.9843750298023224, + "step": 66 + }, + { + "completion_length": 331.2901954650879, + "epoch": 0.08461658111681443, + "grad_norm": 0.06362960710704729, + "kl": 0.0567474365234375, + "learning_rate": 4.813130610139993e-07, + "loss": 0.0001, + "reward": 1.2455357611179352, + "reward_std": 0.28113956190645695, + "rewards/equation_reward_func": 0.2566964430734515, + "rewards/format_reward_func": 0.9888393133878708, + "step": 68 + }, + { + "completion_length": 351.97880935668945, + "epoch": 0.08710530409083839, + "grad_norm": 0.06267945194538582, + "kl": 0.05755615234375, + "learning_rate": 4.799223798941089e-07, + "loss": 0.0001, + "reward": 1.1930804252624512, + "reward_std": 0.2554375780746341, + "rewards/equation_reward_func": 0.20758929662406445, + "rewards/format_reward_func": 0.9854910895228386, + "step": 70 + }, + { + "completion_length": 335.7288064956665, + "epoch": 0.08959402706486234, + "grad_norm": 0.06583286191782552, + "kl": 0.0636749267578125, + "learning_rate": 4.78483950191177e-07, + "loss": 0.0001, + "reward": 1.2488839849829674, + "reward_std": 0.31368037685751915, + "rewards/equation_reward_func": 0.26562501210719347, + "rewards/format_reward_func": 0.9832589663565159, + "step": 72 + }, + { + "completion_length": 359.6205539703369, + "epoch": 0.0920827500388863, + "grad_norm": 0.05887884685941389, + "kl": 0.067291259765625, + "learning_rate": 4.769980706276687e-07, + "loss": 0.0001, + "reward": 1.2299107685685158, + "reward_std": 0.33461445197463036, + "rewards/equation_reward_func": 0.26116072945296764, + "rewards/format_reward_func": 0.9687500298023224, + "step": 74 + }, + { + "completion_length": 356.4163131713867, + "epoch": 0.09457147301291025, + "grad_norm": 0.06235340328160086, + "kl": 0.074432373046875, + "learning_rate": 4.7546504978008595e-07, + "loss": 0.0001, + "reward": 1.3080357611179352, + "reward_std": 0.3593567367643118, + "rewards/equation_reward_func": 0.3303571594879031, + "rewards/format_reward_func": 0.977678619325161, + "step": 76 + }, + { + "completion_length": 375.3147506713867, + "epoch": 0.0970601959869342, + "grad_norm": 0.056324331796943045, + "kl": 0.07568359375, + "learning_rate": 4.738852060148848e-07, + "loss": 0.0001, + "reward": 1.2433036267757416, + "reward_std": 0.310510310344398, + "rewards/equation_reward_func": 0.26897322572767735, + "rewards/format_reward_func": 0.9743303880095482, + "step": 78 + }, + { + "completion_length": 378.6038131713867, + "epoch": 0.09954891896095816, + "grad_norm": 0.06544056788087135, + "kl": 0.079559326171875, + "learning_rate": 4.722588674223593e-07, + "loss": 0.0001, + "reward": 1.241071492433548, + "reward_std": 0.3315843231976032, + "rewards/equation_reward_func": 0.2767857280559838, + "rewards/format_reward_func": 0.9642857424914837, + "step": 80 + }, + { + "completion_length": 371.5558223724365, + "epoch": 0.10203764193498212, + "grad_norm": 0.06000338506612649, + "kl": 0.09228515625, + "learning_rate": 4.70586371748506e-07, + "loss": 0.0001, + "reward": 1.2734375521540642, + "reward_std": 0.32439365796744823, + "rewards/equation_reward_func": 0.3113839365541935, + "rewards/format_reward_func": 0.9620535932481289, + "step": 82 + }, + { + "completion_length": 360.88952445983887, + "epoch": 0.10452636490900606, + "grad_norm": 0.0662228531842243, + "kl": 0.095611572265625, + "learning_rate": 4.6886806632488363e-07, + "loss": 0.0001, + "reward": 1.306919701397419, + "reward_std": 0.3095084084197879, + "rewards/equation_reward_func": 0.3314732317812741, + "rewards/format_reward_func": 0.9754464700818062, + "step": 84 + }, + { + "completion_length": 379.3147487640381, + "epoch": 0.10701508788303002, + "grad_norm": 0.060174589846167865, + "kl": 0.093414306640625, + "learning_rate": 4.6710430799648143e-07, + "loss": 0.0001, + "reward": 1.2667411416769028, + "reward_std": 0.3022028226405382, + "rewards/equation_reward_func": 0.3035714430734515, + "rewards/format_reward_func": 0.9631696790456772, + "step": 86 + }, + { + "completion_length": 371.4241237640381, + "epoch": 0.10950381085705398, + "grad_norm": 0.058997581427704456, + "kl": 0.1055908203125, + "learning_rate": 4.652954630476127e-07, + "loss": 0.0001, + "reward": 1.3046875596046448, + "reward_std": 0.32442515436559916, + "rewards/equation_reward_func": 0.34040180407464504, + "rewards/format_reward_func": 0.9642857387661934, + "step": 88 + }, + { + "completion_length": 399.9319362640381, + "epoch": 0.11199253383107793, + "grad_norm": 0.06053909398263049, + "kl": 0.101837158203125, + "learning_rate": 4.6344190712584713e-07, + "loss": 0.0001, + "reward": 1.3102679252624512, + "reward_std": 0.3171618916094303, + "rewards/equation_reward_func": 0.34709823597222567, + "rewards/format_reward_func": 0.9631696753203869, + "step": 90 + }, + { + "completion_length": 408.24667167663574, + "epoch": 0.11448125680510188, + "grad_norm": 0.05672443722539237, + "kl": 0.103118896484375, + "learning_rate": 4.615440251639995e-07, + "loss": 0.0001, + "reward": 1.284598283469677, + "reward_std": 0.361779160797596, + "rewards/equation_reward_func": 0.34486608672887087, + "rewards/format_reward_func": 0.9397321753203869, + "step": 92 + }, + { + "completion_length": 415.2946605682373, + "epoch": 0.11696997977912583, + "grad_norm": 0.05701659561324134, + "kl": 0.10345458984375, + "learning_rate": 4.596022113001894e-07, + "loss": 0.0001, + "reward": 1.2979911342263222, + "reward_std": 0.32484395429491997, + "rewards/equation_reward_func": 0.3582589440047741, + "rewards/format_reward_func": 0.9397321753203869, + "step": 94 + }, + { + "completion_length": 399.2433166503906, + "epoch": 0.11945870275314979, + "grad_norm": 0.06305880755834348, + "kl": 0.118804931640625, + "learning_rate": 4.576168687959895e-07, + "loss": 0.0001, + "reward": 1.3872768357396126, + "reward_std": 0.3481318447738886, + "rewards/equation_reward_func": 0.4397321678698063, + "rewards/format_reward_func": 0.9475446678698063, + "step": 96 + }, + { + "completion_length": 426.3482360839844, + "epoch": 0.12194742572717375, + "grad_norm": 0.047999431553062445, + "kl": 0.10955810546875, + "learning_rate": 4.555884099526793e-07, + "loss": 0.0001, + "reward": 1.3370536267757416, + "reward_std": 0.29146868363022804, + "rewards/equation_reward_func": 0.3917410857975483, + "rewards/format_reward_func": 0.9453125335276127, + "step": 98 + }, + { + "completion_length": 422.6651945114136, + "epoch": 0.1244361487011977, + "grad_norm": 0.050797654511719595, + "kl": 0.111175537109375, + "learning_rate": 4.5351725602562174e-07, + "loss": 0.0001, + "reward": 1.3337054178118706, + "reward_std": 0.2792348740622401, + "rewards/equation_reward_func": 0.3816964514553547, + "rewards/format_reward_func": 0.9520089626312256, + "step": 100 + }, + { + "completion_length": 452.9520320892334, + "epoch": 0.12692487167522165, + "grad_norm": 0.05486761712388945, + "kl": 0.114166259765625, + "learning_rate": 4.514038371367791e-07, + "loss": 0.0001, + "reward": 1.2745536230504513, + "reward_std": 0.3251532930880785, + "rewards/equation_reward_func": 0.35602680617012084, + "rewards/format_reward_func": 0.9185268245637417, + "step": 102 + }, + { + "completion_length": 412.76118087768555, + "epoch": 0.1294135946492456, + "grad_norm": 0.05179336901472077, + "kl": 0.12225341796875, + "learning_rate": 4.4924859218538936e-07, + "loss": 0.0001, + "reward": 1.3984375521540642, + "reward_std": 0.2861457858234644, + "rewards/equation_reward_func": 0.4520089542493224, + "rewards/format_reward_func": 0.9464286118745804, + "step": 104 + }, + { + "completion_length": 404.86943435668945, + "epoch": 0.13190231762326957, + "grad_norm": 0.053536495931847755, + "kl": 0.123687744140625, + "learning_rate": 4.470519687568185e-07, + "loss": 0.0001, + "reward": 1.381696492433548, + "reward_std": 0.2666415721178055, + "rewards/equation_reward_func": 0.4274553805589676, + "rewards/format_reward_func": 0.9542411118745804, + "step": 106 + }, + { + "completion_length": 407.1082763671875, + "epoch": 0.1343910405972935, + "grad_norm": 0.05215816107862381, + "kl": 0.13446044921875, + "learning_rate": 4.4481442302960923e-07, + "loss": 0.0001, + "reward": 1.3805804252624512, + "reward_std": 0.3346856739372015, + "rewards/equation_reward_func": 0.43750002048909664, + "rewards/format_reward_func": 0.9430803917348385, + "step": 108 + }, + { + "completion_length": 414.9018039703369, + "epoch": 0.13687976357131748, + "grad_norm": 0.06646824899059828, + "kl": 0.138336181640625, + "learning_rate": 4.4253641968074505e-07, + "loss": 0.0001, + "reward": 1.3604911416769028, + "reward_std": 0.25776811968535185, + "rewards/equation_reward_func": 0.4051339514553547, + "rewards/format_reward_func": 0.9553571715950966, + "step": 110 + }, + { + "completion_length": 445.246675491333, + "epoch": 0.13936848654534142, + "grad_norm": 0.05260455171982223, + "kl": 0.124481201171875, + "learning_rate": 4.402184317891501e-07, + "loss": 0.0001, + "reward": 1.2991072088479996, + "reward_std": 0.2543983329087496, + "rewards/equation_reward_func": 0.3404018022119999, + "rewards/format_reward_func": 0.9587054029107094, + "step": 112 + }, + { + "completion_length": 386.75336170196533, + "epoch": 0.14185720951936537, + "grad_norm": 0.06276933769672523, + "kl": 0.12603759765625, + "learning_rate": 4.37860940737443e-07, + "loss": 0.0001, + "reward": 1.4441965073347092, + "reward_std": 0.27539225295186043, + "rewards/equation_reward_func": 0.4843750214204192, + "rewards/format_reward_func": 0.9598214626312256, + "step": 114 + }, + { + "completion_length": 409.517879486084, + "epoch": 0.14434593249338934, + "grad_norm": 0.046210489105058865, + "kl": 0.13018798828125, + "learning_rate": 4.354644361119671e-07, + "loss": 0.0001, + "reward": 1.3660714998841286, + "reward_std": 0.2605076776817441, + "rewards/equation_reward_func": 0.4185268050059676, + "rewards/format_reward_func": 0.9475446715950966, + "step": 116 + }, + { + "completion_length": 381.48215675354004, + "epoch": 0.14683465546741328, + "grad_norm": 0.04626076501226659, + "kl": 0.13671875, + "learning_rate": 4.3302941560111716e-07, + "loss": 0.0001, + "reward": 1.448660783469677, + "reward_std": 0.24480629619210958, + "rewards/equation_reward_func": 0.48437502048909664, + "rewards/format_reward_func": 0.9642857387661934, + "step": 118 + }, + { + "completion_length": 375.8002405166626, + "epoch": 0.14932337844143723, + "grad_norm": 0.064347259929319, + "kl": 0.132171630859375, + "learning_rate": 4.3055638489198236e-07, + "loss": 0.0001, + "reward": 1.4508929252624512, + "reward_std": 0.31021546106785536, + "rewards/equation_reward_func": 0.48660717345774174, + "rewards/format_reward_func": 0.964285746216774, + "step": 120 + }, + { + "completion_length": 395.19197845458984, + "epoch": 0.1518121014154612, + "grad_norm": 0.05844318115286761, + "kl": 0.141693115234375, + "learning_rate": 4.280458575653296e-07, + "loss": 0.0001, + "reward": 1.4040179029107094, + "reward_std": 0.2540714908391237, + "rewards/equation_reward_func": 0.4363839477300644, + "rewards/format_reward_func": 0.9676339514553547, + "step": 122 + }, + { + "completion_length": 358.8236789703369, + "epoch": 0.15430082438948514, + "grad_norm": 0.052114516892564085, + "kl": 0.14666748046875, + "learning_rate": 4.2549835498894665e-07, + "loss": 0.0001, + "reward": 1.504464365541935, + "reward_std": 0.2538653062656522, + "rewards/equation_reward_func": 0.5290178880095482, + "rewards/format_reward_func": 0.9754464663565159, + "step": 124 + }, + { + "completion_length": 393.2901954650879, + "epoch": 0.1567895473635091, + "grad_norm": 0.05823650722611721, + "kl": 0.162750244140625, + "learning_rate": 4.229144062093679e-07, + "loss": 0.0002, + "reward": 1.4051339849829674, + "reward_std": 0.2523822980001569, + "rewards/equation_reward_func": 0.4375000260770321, + "rewards/format_reward_func": 0.9676339589059353, + "step": 126 + }, + { + "completion_length": 405.56251525878906, + "epoch": 0.15927827033753306, + "grad_norm": 0.06351569565773, + "kl": 0.142913818359375, + "learning_rate": 4.2029454784200675e-07, + "loss": 0.0001, + "reward": 1.369419701397419, + "reward_std": 0.23465343983843923, + "rewards/equation_reward_func": 0.40736608766019344, + "rewards/format_reward_func": 0.9620536044239998, + "step": 128 + }, + { + "completion_length": 374.26675510406494, + "epoch": 0.161766993311557, + "grad_norm": 0.058600891047310276, + "kl": 0.141693115234375, + "learning_rate": 4.1763932395971433e-07, + "loss": 0.0001, + "reward": 1.452008992433548, + "reward_std": 0.2408639071509242, + "rewards/equation_reward_func": 0.4765625260770321, + "rewards/format_reward_func": 0.9754464589059353, + "step": 130 + }, + { + "completion_length": 358.2567148208618, + "epoch": 0.16425571628558097, + "grad_norm": 0.05496069479334609, + "kl": 0.1519775390625, + "learning_rate": 4.1494928597979117e-07, + "loss": 0.0002, + "reward": 1.500000074505806, + "reward_std": 0.21514854487031698, + "rewards/equation_reward_func": 0.5200893096625805, + "rewards/format_reward_func": 0.9799107536673546, + "step": 132 + }, + { + "completion_length": 352.5524682998657, + "epoch": 0.16674443925960492, + "grad_norm": 0.05248231582575076, + "kl": 0.16265869140625, + "learning_rate": 4.122249925494726e-07, + "loss": 0.0002, + "reward": 1.4966518506407738, + "reward_std": 0.215032197535038, + "rewards/equation_reward_func": 0.5089285932481289, + "rewards/format_reward_func": 0.9877232536673546, + "step": 134 + }, + { + "completion_length": 366.6317138671875, + "epoch": 0.16923316223362886, + "grad_norm": 0.05679988919891403, + "kl": 0.142303466796875, + "learning_rate": 4.094670094299131e-07, + "loss": 0.0001, + "reward": 1.444196492433548, + "reward_std": 0.2186202765442431, + "rewards/equation_reward_func": 0.4732143059372902, + "rewards/format_reward_func": 0.9709821753203869, + "step": 136 + }, + { + "completion_length": 359.1785888671875, + "epoch": 0.17172188520765283, + "grad_norm": 0.0670324226853738, + "kl": 0.156280517578125, + "learning_rate": 4.066759093786931e-07, + "loss": 0.0002, + "reward": 1.4252232685685158, + "reward_std": 0.1616944009438157, + "rewards/equation_reward_func": 0.43750002095475793, + "rewards/format_reward_func": 0.9877232499420643, + "step": 138 + }, + { + "completion_length": 383.5435447692871, + "epoch": 0.17421060818167677, + "grad_norm": 0.04649149273407711, + "kl": 0.14532470703125, + "learning_rate": 4.038522720308732e-07, + "loss": 0.0001, + "reward": 1.3526786342263222, + "reward_std": 0.16552409389987588, + "rewards/equation_reward_func": 0.36607144365552813, + "rewards/format_reward_func": 0.9866071566939354, + "step": 140 + }, + { + "completion_length": 372.57144927978516, + "epoch": 0.17669933115570072, + "grad_norm": 0.05097142037201984, + "kl": 0.22589111328125, + "learning_rate": 4.009966837786194e-07, + "loss": 0.0002, + "reward": 1.3928572311997414, + "reward_std": 0.20025141583755612, + "rewards/equation_reward_func": 0.40513395331799984, + "rewards/format_reward_func": 0.9877232536673546, + "step": 142 + }, + { + "completion_length": 356.07032585144043, + "epoch": 0.1791880541297247, + "grad_norm": 0.05501640500795023, + "kl": 0.153076171875, + "learning_rate": 3.981097376494259e-07, + "loss": 0.0002, + "reward": 1.4654018506407738, + "reward_std": 0.2332756402902305, + "rewards/equation_reward_func": 0.4787946678698063, + "rewards/format_reward_func": 0.9866071753203869, + "step": 144 + }, + { + "completion_length": 359.5089416503906, + "epoch": 0.18167677710374863, + "grad_norm": 0.03960504940392292, + "kl": 0.1627197265625, + "learning_rate": 3.951920331829592e-07, + "loss": 0.0002, + "reward": 1.3950893431901932, + "reward_std": 0.20504061924293637, + "rewards/equation_reward_func": 0.4140625176951289, + "rewards/format_reward_func": 0.9810268096625805, + "step": 146 + }, + { + "completion_length": 340.59376525878906, + "epoch": 0.1841655000777726, + "grad_norm": 0.0522427513812835, + "kl": 0.16888427734375, + "learning_rate": 3.922441763065506e-07, + "loss": 0.0002, + "reward": 1.4464286416769028, + "reward_std": 0.16819261107593775, + "rewards/equation_reward_func": 0.45982144959270954, + "rewards/format_reward_func": 0.9866071790456772, + "step": 148 + }, + { + "completion_length": 355.54354095458984, + "epoch": 0.18665422305179655, + "grad_norm": 0.05897953255292171, + "kl": 0.16357421875, + "learning_rate": 3.8926677920936093e-07, + "loss": 0.0002, + "reward": 1.453125074505806, + "reward_std": 0.22553037758916616, + "rewards/equation_reward_func": 0.47433038242161274, + "rewards/format_reward_func": 0.9787946678698063, + "step": 150 + }, + { + "completion_length": 330.8404178619385, + "epoch": 0.1891429460258205, + "grad_norm": 0.05627495445361396, + "kl": 0.17462158203125, + "learning_rate": 3.862604602152464e-07, + "loss": 0.0002, + "reward": 1.4352679178118706, + "reward_std": 0.19060763390734792, + "rewards/equation_reward_func": 0.45982144959270954, + "rewards/format_reward_func": 0.9754464700818062, + "step": 152 + }, + { + "completion_length": 338.2745656967163, + "epoch": 0.19163166899984446, + "grad_norm": 0.04910199366203511, + "kl": 0.16571044921875, + "learning_rate": 3.8322584365434934e-07, + "loss": 0.0002, + "reward": 1.4654018580913544, + "reward_std": 0.2223955481313169, + "rewards/equation_reward_func": 0.48214288242161274, + "rewards/format_reward_func": 0.9832589626312256, + "step": 154 + }, + { + "completion_length": 352.1216697692871, + "epoch": 0.1941203919738684, + "grad_norm": 0.05356327173771425, + "kl": 0.16558837890625, + "learning_rate": 3.8016355973344173e-07, + "loss": 0.0002, + "reward": 1.4308036416769028, + "reward_std": 0.18950919900089502, + "rewards/equation_reward_func": 0.45089287869632244, + "rewards/format_reward_func": 0.979910746216774, + "step": 156 + }, + { + "completion_length": 351.04577255249023, + "epoch": 0.19660911494789235, + "grad_norm": 0.06141645509073623, + "kl": 0.17547607421875, + "learning_rate": 3.7707424440504863e-07, + "loss": 0.0002, + "reward": 1.4363839998841286, + "reward_std": 0.21332781156525016, + "rewards/equation_reward_func": 0.45535716600716114, + "rewards/format_reward_func": 0.9810268171131611, + "step": 158 + }, + { + "completion_length": 320.54688930511475, + "epoch": 0.19909783792191632, + "grad_norm": 0.05781227739788321, + "kl": 0.18389892578125, + "learning_rate": 3.739585392353787e-07, + "loss": 0.0002, + "reward": 1.4341518580913544, + "reward_std": 0.20938572334125638, + "rewards/equation_reward_func": 0.4520089542493224, + "rewards/format_reward_func": 0.9821428991854191, + "step": 160 + }, + { + "completion_length": 340.25336360931396, + "epoch": 0.20158656089594026, + "grad_norm": 0.06477984340724512, + "kl": 0.18438720703125, + "learning_rate": 3.7081709127108767e-07, + "loss": 0.0002, + "reward": 1.3917411416769028, + "reward_std": 0.24160758964717388, + "rewards/equation_reward_func": 0.4319196632131934, + "rewards/format_reward_func": 0.9598214700818062, + "step": 162 + }, + { + "completion_length": 347.57479190826416, + "epoch": 0.20407528386996424, + "grad_norm": 0.07120213043946341, + "kl": 0.186279296875, + "learning_rate": 3.6765055290490513e-07, + "loss": 0.0002, + "reward": 1.373883992433548, + "reward_std": 0.21425227960571647, + "rewards/equation_reward_func": 0.4084821604192257, + "rewards/format_reward_func": 0.9654018245637417, + "step": 164 + }, + { + "completion_length": 342.25671195983887, + "epoch": 0.20656400684398818, + "grad_norm": 0.06700342546108162, + "kl": 0.1981201171875, + "learning_rate": 3.644595817401501e-07, + "loss": 0.0002, + "reward": 1.4140625521540642, + "reward_std": 0.24193571787327528, + "rewards/equation_reward_func": 0.45200894959270954, + "rewards/format_reward_func": 0.9620536081492901, + "step": 166 + }, + { + "completion_length": 340.312518119812, + "epoch": 0.20905272981801212, + "grad_norm": 0.08762287914289317, + "kl": 0.2086181640625, + "learning_rate": 3.6124484045416483e-07, + "loss": 0.0002, + "reward": 1.400669701397419, + "reward_std": 0.24582227924838662, + "rewards/equation_reward_func": 0.4453125214204192, + "rewards/format_reward_func": 0.9553571827709675, + "step": 168 + }, + { + "completion_length": 354.2154188156128, + "epoch": 0.2115414527920361, + "grad_norm": 0.05256734039133035, + "kl": 0.20733642578125, + "learning_rate": 3.580069966606949e-07, + "loss": 0.0002, + "reward": 1.3705357760190964, + "reward_std": 0.22536195535212755, + "rewards/equation_reward_func": 0.4185268005821854, + "rewards/format_reward_func": 0.9520089626312256, + "step": 170 + }, + { + "completion_length": 335.11161613464355, + "epoch": 0.21403017576606004, + "grad_norm": 0.06944613130624071, + "kl": 0.19964599609375, + "learning_rate": 3.547467227712444e-07, + "loss": 0.0002, + "reward": 1.4285714775323868, + "reward_std": 0.27147548273205757, + "rewards/equation_reward_func": 0.47991073317825794, + "rewards/format_reward_func": 0.9486607424914837, + "step": 172 + }, + { + "completion_length": 311.1305913925171, + "epoch": 0.21651889874008398, + "grad_norm": 0.08671053778094895, + "kl": 0.2025146484375, + "learning_rate": 3.5146469585543386e-07, + "loss": 0.0002, + "reward": 1.484375074505806, + "reward_std": 0.26195389963686466, + "rewards/equation_reward_func": 0.5368303805589676, + "rewards/format_reward_func": 0.9475446790456772, + "step": 174 + }, + { + "completion_length": 350.00894355773926, + "epoch": 0.21900762171410795, + "grad_norm": 0.06615215528616859, + "kl": 0.2117919921875, + "learning_rate": 3.481615975003922e-07, + "loss": 0.0002, + "reward": 1.3694197088479996, + "reward_std": 0.27513020671904087, + "rewards/equation_reward_func": 0.43191966973245144, + "rewards/format_reward_func": 0.9375000335276127, + "step": 176 + }, + { + "completion_length": 338.06139945983887, + "epoch": 0.2214963446881319, + "grad_norm": 0.054349578220732504, + "kl": 0.21484375, + "learning_rate": 3.448381136692089e-07, + "loss": 0.0002, + "reward": 1.429687574505806, + "reward_std": 0.2586075942963362, + "rewards/equation_reward_func": 0.48995537497103214, + "rewards/format_reward_func": 0.9397321790456772, + "step": 178 + }, + { + "completion_length": 359.5156421661377, + "epoch": 0.22398506766215587, + "grad_norm": 0.05374122628526808, + "kl": 0.20916748046875, + "learning_rate": 3.4149493455847897e-07, + "loss": 0.0002, + "reward": 1.3493304252624512, + "reward_std": 0.23989787977188826, + "rewards/equation_reward_func": 0.4095982275903225, + "rewards/format_reward_func": 0.9397321827709675, + "step": 180 + }, + { + "completion_length": 342.4587211608887, + "epoch": 0.2264737906361798, + "grad_norm": 0.06811808864322311, + "kl": 0.23675537109375, + "learning_rate": 3.3813275445496766e-07, + "loss": 0.0002, + "reward": 1.38839291036129, + "reward_std": 0.24801104608923197, + "rewards/equation_reward_func": 0.45089287497103214, + "rewards/format_reward_func": 0.937500037252903, + "step": 182 + }, + { + "completion_length": 345.0446605682373, + "epoch": 0.22896251361020376, + "grad_norm": 0.06987324492754955, + "kl": 0.22637939453125, + "learning_rate": 3.347522715914262e-07, + "loss": 0.0002, + "reward": 1.3917411267757416, + "reward_std": 0.2438207296654582, + "rewards/equation_reward_func": 0.45312501722946763, + "rewards/format_reward_func": 0.9386161118745804, + "step": 184 + }, + { + "completion_length": 307.60269260406494, + "epoch": 0.23145123658422773, + "grad_norm": 0.08559276579960963, + "kl": 0.22283935546875, + "learning_rate": 3.313541880015877e-07, + "loss": 0.0002, + "reward": 1.4631697162985802, + "reward_std": 0.27263635816052556, + "rewards/equation_reward_func": 0.5200893082655966, + "rewards/format_reward_func": 0.9430803954601288, + "step": 186 + }, + { + "completion_length": 333.93305015563965, + "epoch": 0.23393995955825167, + "grad_norm": 0.06886906420831151, + "kl": 0.21905517578125, + "learning_rate": 3.279392093743747e-07, + "loss": 0.0002, + "reward": 1.4029018431901932, + "reward_std": 0.26216446328908205, + "rewards/equation_reward_func": 0.47321430779993534, + "rewards/format_reward_func": 0.929687537252903, + "step": 188 + }, + { + "completion_length": 334.85827350616455, + "epoch": 0.2364286825322756, + "grad_norm": 0.054404156906439176, + "kl": 0.22149658203125, + "learning_rate": 3.245080449073459e-07, + "loss": 0.0002, + "reward": 1.400669701397419, + "reward_std": 0.22941731940954924, + "rewards/equation_reward_func": 0.45200895238667727, + "rewards/format_reward_func": 0.948660746216774, + "step": 190 + }, + { + "completion_length": 318.9564838409424, + "epoch": 0.23891740550629958, + "grad_norm": 0.07343897062684883, + "kl": 0.228271484375, + "learning_rate": 3.210614071594162e-07, + "loss": 0.0002, + "reward": 1.439732201397419, + "reward_std": 0.2519109146669507, + "rewards/equation_reward_func": 0.49330359511077404, + "rewards/format_reward_func": 0.9464286044239998, + "step": 192 + }, + { + "completion_length": 338.8672037124634, + "epoch": 0.24140612848032353, + "grad_norm": 0.061350768494073026, + "kl": 0.2132568359375, + "learning_rate": 3.1760001190287695e-07, + "loss": 0.0002, + "reward": 1.3816964887082577, + "reward_std": 0.23298237565904856, + "rewards/equation_reward_func": 0.4363839430734515, + "rewards/format_reward_func": 0.945312537252903, + "step": 194 + }, + { + "completion_length": 345.0937671661377, + "epoch": 0.2438948514543475, + "grad_norm": 0.06872187414027332, + "kl": 0.213134765625, + "learning_rate": 3.141245779747502e-07, + "loss": 0.0002, + "reward": 1.3638393431901932, + "reward_std": 0.239340515807271, + "rewards/equation_reward_func": 0.41294644493609667, + "rewards/format_reward_func": 0.9508928954601288, + "step": 196 + }, + { + "completion_length": 310.77680015563965, + "epoch": 0.24638357442837144, + "grad_norm": 5.443595942007072, + "kl": 7.49005126953125, + "learning_rate": 3.106358271275056e-07, + "loss": 0.0075, + "reward": 1.4464286342263222, + "reward_std": 0.2085065320134163, + "rewards/equation_reward_func": 0.48995538614690304, + "rewards/format_reward_func": 0.9564732499420643, + "step": 198 + }, + { + "completion_length": 312.64845085144043, + "epoch": 0.2488722974023954, + "grad_norm": 0.06598180406690658, + "kl": 0.22442626953125, + "learning_rate": 3.0713448387917227e-07, + "loss": 0.0002, + "reward": 1.4129464961588383, + "reward_std": 0.23078837245702744, + "rewards/equation_reward_func": 0.45535716926679015, + "rewards/format_reward_func": 0.9575893171131611, + "step": 200 + }, + { + "completion_length": 312.81363010406494, + "epoch": 0.25136102037641933, + "grad_norm": 0.4754247351711236, + "kl": 0.2811279296875, + "learning_rate": 3.0362127536287636e-07, + "loss": 0.0003, + "reward": 1.4542411416769028, + "reward_std": 0.23245403449982405, + "rewards/equation_reward_func": 0.5022321697324514, + "rewards/format_reward_func": 0.9520089626312256, + "step": 202 + }, + { + "completion_length": 314.4732246398926, + "epoch": 0.2538497433504433, + "grad_norm": 0.07156843273118213, + "kl": 0.25048828125, + "learning_rate": 3.0009693117583523e-07, + "loss": 0.0003, + "reward": 1.4062500596046448, + "reward_std": 0.20789815485477448, + "rewards/equation_reward_func": 0.45089287497103214, + "rewards/format_reward_func": 0.9553571864962578, + "step": 204 + }, + { + "completion_length": 326.76229190826416, + "epoch": 0.2563384663244673, + "grad_norm": 0.06704094931913333, + "kl": 0.20635986328125, + "learning_rate": 2.965621832278401e-07, + "loss": 0.0002, + "reward": 1.4084822088479996, + "reward_std": 0.24688747199252248, + "rewards/equation_reward_func": 0.46428573690354824, + "rewards/format_reward_func": 0.9441964663565159, + "step": 206 + }, + { + "completion_length": 319.1551504135132, + "epoch": 0.2588271892984912, + "grad_norm": 0.06458932073742, + "kl": 0.21240234375, + "learning_rate": 2.9301776558925875e-07, + "loss": 0.0002, + "reward": 1.4196429327130318, + "reward_std": 0.24886887054890394, + "rewards/equation_reward_func": 0.4698660932481289, + "rewards/format_reward_func": 0.9497768171131611, + "step": 208 + }, + { + "completion_length": 330.76676177978516, + "epoch": 0.26131591227251516, + "grad_norm": 0.06508155230407775, + "kl": 0.21636962890625, + "learning_rate": 2.894644143385885e-07, + "loss": 0.0002, + "reward": 1.3638393506407738, + "reward_std": 0.26955581549555063, + "rewards/equation_reward_func": 0.42075895611196756, + "rewards/format_reward_func": 0.9430803917348385, + "step": 210 + }, + { + "completion_length": 291.4464406967163, + "epoch": 0.26380463524653913, + "grad_norm": 0.0833854899576959, + "kl": 0.226318359375, + "learning_rate": 2.859028674095937e-07, + "loss": 0.0002, + "reward": 1.4408482760190964, + "reward_std": 0.22698505548760295, + "rewards/equation_reward_func": 0.49665181897580624, + "rewards/format_reward_func": 0.9441964626312256, + "step": 212 + }, + { + "completion_length": 309.15961360931396, + "epoch": 0.26629335822056305, + "grad_norm": 0.05103001730987287, + "kl": 0.21319580078125, + "learning_rate": 2.823338644380566e-07, + "loss": 0.0002, + "reward": 1.4430804327130318, + "reward_std": 0.2395549127832055, + "rewards/equation_reward_func": 0.497767879627645, + "rewards/format_reward_func": 0.945312537252903, + "step": 214 + }, + { + "completion_length": 310.4118423461914, + "epoch": 0.268782081194587, + "grad_norm": 0.07403319863620571, + "kl": 0.22412109375, + "learning_rate": 2.7875814660817504e-07, + "loss": 0.0002, + "reward": 1.386160783469677, + "reward_std": 0.24659961089491844, + "rewards/equation_reward_func": 0.43973216135054827, + "rewards/format_reward_func": 0.9464286044239998, + "step": 216 + }, + { + "completion_length": 305.60938930511475, + "epoch": 0.271270804168611, + "grad_norm": 0.05773673792340038, + "kl": 0.213623046875, + "learning_rate": 2.751764564986396e-07, + "loss": 0.0002, + "reward": 1.3872768506407738, + "reward_std": 0.19503082614392042, + "rewards/equation_reward_func": 0.4308035932481289, + "rewards/format_reward_func": 0.9564732499420643, + "step": 218 + }, + { + "completion_length": 290.44420623779297, + "epoch": 0.27375952714263496, + "grad_norm": 0.05392804528737292, + "kl": 0.2159423828125, + "learning_rate": 2.715895379284194e-07, + "loss": 0.0002, + "reward": 1.4475447162985802, + "reward_std": 0.20527297724038363, + "rewards/equation_reward_func": 0.49776787776499987, + "rewards/format_reward_func": 0.9497768208384514, + "step": 220 + }, + { + "completion_length": 305.9788074493408, + "epoch": 0.2762482501166589, + "grad_norm": 0.05980760400922627, + "kl": 0.216796875, + "learning_rate": 2.6799813580229174e-07, + "loss": 0.0002, + "reward": 1.4207590073347092, + "reward_std": 0.22403404489159584, + "rewards/equation_reward_func": 0.4687500260770321, + "rewards/format_reward_func": 0.9520089663565159, + "step": 222 + }, + { + "completion_length": 272.02791595458984, + "epoch": 0.27873697309068285, + "grad_norm": 0.08303222816911335, + "kl": 0.24041748046875, + "learning_rate": 2.6440299595614606e-07, + "loss": 0.0002, + "reward": 1.457589365541935, + "reward_std": 0.23546006111428142, + "rewards/equation_reward_func": 0.5044643115252256, + "rewards/format_reward_func": 0.953125037252903, + "step": 224 + }, + { + "completion_length": 280.05023670196533, + "epoch": 0.2812256960647068, + "grad_norm": 0.05404811960392472, + "kl": 0.2314453125, + "learning_rate": 2.6080486500209347e-07, + "loss": 0.0002, + "reward": 1.5022322237491608, + "reward_std": 0.22998644690960646, + "rewards/equation_reward_func": 0.5479910960420966, + "rewards/format_reward_func": 0.9542410969734192, + "step": 226 + }, + { + "completion_length": 304.1093921661377, + "epoch": 0.28371441903873074, + "grad_norm": 0.06300739916900569, + "kl": 0.241943359375, + "learning_rate": 2.572044901734166e-07, + "loss": 0.0002, + "reward": 1.3872768469154835, + "reward_std": 0.2272398821078241, + "rewards/equation_reward_func": 0.4408482362050563, + "rewards/format_reward_func": 0.9464286118745804, + "step": 228 + }, + { + "completion_length": 264.1930923461914, + "epoch": 0.2862031420127547, + "grad_norm": 0.06856109499172447, + "kl": 0.22003173828125, + "learning_rate": 2.536026191693893e-07, + "loss": 0.0002, + "reward": 1.5446429327130318, + "reward_std": 0.23560786852613091, + "rewards/equation_reward_func": 0.5837053805589676, + "rewards/format_reward_func": 0.9609375298023224, + "step": 230 + }, + { + "completion_length": 280.08818531036377, + "epoch": 0.2886918649867787, + "grad_norm": 0.06460311962128547, + "kl": 0.22894287109375, + "learning_rate": 2.5e-07, + "loss": 0.0002, + "reward": 1.4776786416769028, + "reward_std": 0.25147050712257624, + "rewards/equation_reward_func": 0.5334821678698063, + "rewards/format_reward_func": 0.9441964663565159, + "step": 232 + }, + { + "completion_length": 291.1105031967163, + "epoch": 0.2911805879608026, + "grad_norm": 0.06575064642151073, + "kl": 0.2237548828125, + "learning_rate": 2.4639738083061073e-07, + "loss": 0.0002, + "reward": 1.3683036118745804, + "reward_std": 0.23962750937789679, + "rewards/equation_reward_func": 0.4263393087312579, + "rewards/format_reward_func": 0.9419643133878708, + "step": 234 + }, + { + "completion_length": 289.46653175354004, + "epoch": 0.29366931093482657, + "grad_norm": 0.06296182617357601, + "kl": 0.21917724609375, + "learning_rate": 2.4279550982658345e-07, + "loss": 0.0002, + "reward": 1.421875074505806, + "reward_std": 0.23982096277177334, + "rewards/equation_reward_func": 0.4698660895228386, + "rewards/format_reward_func": 0.9520089663565159, + "step": 236 + }, + { + "completion_length": 277.73662281036377, + "epoch": 0.29615803390885054, + "grad_norm": 0.06887502467667868, + "kl": 0.21881103515625, + "learning_rate": 2.3919513499790646e-07, + "loss": 0.0002, + "reward": 1.4430804252624512, + "reward_std": 0.23861057311296463, + "rewards/equation_reward_func": 0.47991072945296764, + "rewards/format_reward_func": 0.9631696715950966, + "step": 238 + }, + { + "completion_length": 298.07479190826416, + "epoch": 0.29864675688287445, + "grad_norm": 0.06290785295542843, + "kl": 0.22564697265625, + "learning_rate": 2.3559700404385394e-07, + "loss": 0.0002, + "reward": 1.3906250596046448, + "reward_std": 0.27012846898287535, + "rewards/equation_reward_func": 0.4520089514553547, + "rewards/format_reward_func": 0.9386161081492901, + "step": 240 + }, + { + "completion_length": 267.7533597946167, + "epoch": 0.3011354798568984, + "grad_norm": 0.059074395935352374, + "kl": 0.25567626953125, + "learning_rate": 2.3200186419770823e-07, + "loss": 0.0003, + "reward": 1.48214291036129, + "reward_std": 0.19563588872551918, + "rewards/equation_reward_func": 0.5178571660071611, + "rewards/format_reward_func": 0.9642857424914837, + "step": 242 + }, + { + "completion_length": 270.7366199493408, + "epoch": 0.3036242028309224, + "grad_norm": 0.0709982715482787, + "kl": 0.23052978515625, + "learning_rate": 2.284104620715807e-07, + "loss": 0.0002, + "reward": 1.4497768431901932, + "reward_std": 0.1896849451586604, + "rewards/equation_reward_func": 0.48325894959270954, + "rewards/format_reward_func": 0.9665178917348385, + "step": 244 + }, + { + "completion_length": 264.1417541503906, + "epoch": 0.3061129258049463, + "grad_norm": 0.06526960275231504, + "kl": 0.2496337890625, + "learning_rate": 2.2482354350136043e-07, + "loss": 0.0002, + "reward": 1.4386161267757416, + "reward_std": 0.1712889587506652, + "rewards/equation_reward_func": 0.47767859511077404, + "rewards/format_reward_func": 0.9609375260770321, + "step": 246 + }, + { + "completion_length": 297.9285840988159, + "epoch": 0.3086016487789703, + "grad_norm": 0.0739927662660479, + "kl": 0.22344970703125, + "learning_rate": 2.2124185339182496e-07, + "loss": 0.0002, + "reward": 1.3694197088479996, + "reward_std": 0.2540249917656183, + "rewards/equation_reward_func": 0.4285714498255402, + "rewards/format_reward_func": 0.9408482424914837, + "step": 248 + }, + { + "completion_length": 263.3125104904175, + "epoch": 0.31109037175299425, + "grad_norm": 0.07715164326379821, + "kl": 0.22210693359375, + "learning_rate": 2.1766613556194344e-07, + "loss": 0.0002, + "reward": 1.4218750670552254, + "reward_std": 0.2036459231749177, + "rewards/equation_reward_func": 0.45424109511077404, + "rewards/format_reward_func": 0.967633955180645, + "step": 250 + }, + { + "completion_length": 256.2232255935669, + "epoch": 0.3135790947270182, + "grad_norm": 0.061273497621395105, + "kl": 0.24237060546875, + "learning_rate": 2.1409713259040628e-07, + "loss": 0.0002, + "reward": 1.4832589849829674, + "reward_std": 0.19279880495741963, + "rewards/equation_reward_func": 0.5111607387661934, + "rewards/format_reward_func": 0.9720982424914837, + "step": 252 + }, + { + "completion_length": 251.2701005935669, + "epoch": 0.31606781770104214, + "grad_norm": 0.06269540097192026, + "kl": 0.22998046875, + "learning_rate": 2.105355856614115e-07, + "loss": 0.0002, + "reward": 1.5000000596046448, + "reward_std": 0.181473882868886, + "rewards/equation_reward_func": 0.530133955180645, + "rewards/format_reward_func": 0.9698661006987095, + "step": 254 + }, + { + "completion_length": 270.8817081451416, + "epoch": 0.3185565406750661, + "grad_norm": 0.05361492662421592, + "kl": 0.212646484375, + "learning_rate": 2.069822344107413e-07, + "loss": 0.0002, + "reward": 1.4854911491274834, + "reward_std": 0.22021894436329603, + "rewards/equation_reward_func": 0.5234375316649675, + "rewards/format_reward_func": 0.9620536081492901, + "step": 256 + }, + { + "completion_length": 261.3270215988159, + "epoch": 0.3210452636490901, + "grad_norm": 0.0533864967760835, + "kl": 0.22186279296875, + "learning_rate": 2.034378167721599e-07, + "loss": 0.0002, + "reward": 1.4832590073347092, + "reward_std": 0.16471941815689206, + "rewards/equation_reward_func": 0.5000000186264515, + "rewards/format_reward_func": 0.9832589514553547, + "step": 258 + }, + { + "completion_length": 258.474347114563, + "epoch": 0.323533986623114, + "grad_norm": 0.06040063699395629, + "kl": 0.2305908203125, + "learning_rate": 1.9990306882416485e-07, + "loss": 0.0002, + "reward": 1.452008992433548, + "reward_std": 0.1812770888209343, + "rewards/equation_reward_func": 0.4877232313156128, + "rewards/format_reward_func": 0.964285746216774, + "step": 260 + }, + { + "completion_length": 294.9553689956665, + "epoch": 0.32602270959713797, + "grad_norm": 0.06320814691259159, + "kl": 0.21978759765625, + "learning_rate": 1.9637872463712362e-07, + "loss": 0.0002, + "reward": 1.4263393506407738, + "reward_std": 0.2837945078499615, + "rewards/equation_reward_func": 0.49107145611196756, + "rewards/format_reward_func": 0.9352678917348385, + "step": 262 + }, + { + "completion_length": 264.8705463409424, + "epoch": 0.32851143257116194, + "grad_norm": 0.058570436981231384, + "kl": 0.22821044921875, + "learning_rate": 1.9286551612082773e-07, + "loss": 0.0002, + "reward": 1.41964291036129, + "reward_std": 0.20483079506084323, + "rewards/equation_reward_func": 0.4631696669384837, + "rewards/format_reward_func": 0.9564732499420643, + "step": 264 + }, + { + "completion_length": 260.60046005249023, + "epoch": 0.33100015554518586, + "grad_norm": 0.06631119975940275, + "kl": 0.2242431640625, + "learning_rate": 1.8936417287249446e-07, + "loss": 0.0002, + "reward": 1.4799107909202576, + "reward_std": 0.18420447735115886, + "rewards/equation_reward_func": 0.5212053805589676, + "rewards/format_reward_func": 0.9587053917348385, + "step": 266 + }, + { + "completion_length": 274.5435400009155, + "epoch": 0.33348887851920983, + "grad_norm": 0.05960228260776588, + "kl": 0.21954345703125, + "learning_rate": 1.8587542202524985e-07, + "loss": 0.0002, + "reward": 1.3984375596046448, + "reward_std": 0.19745240919291973, + "rewards/equation_reward_func": 0.4375000218860805, + "rewards/format_reward_func": 0.9609375223517418, + "step": 268 + }, + { + "completion_length": 299.59822940826416, + "epoch": 0.3359776014932338, + "grad_norm": 0.06150696597576238, + "kl": 0.22930908203125, + "learning_rate": 1.82399988097123e-07, + "loss": 0.0002, + "reward": 1.3482143431901932, + "reward_std": 0.23468840029090643, + "rewards/equation_reward_func": 0.40178573317825794, + "rewards/format_reward_func": 0.9464286044239998, + "step": 270 + }, + { + "completion_length": 236.88170623779297, + "epoch": 0.3384663244672577, + "grad_norm": 0.061559128134109485, + "kl": 0.22576904296875, + "learning_rate": 1.7893859284058378e-07, + "loss": 0.0002, + "reward": 1.5546875670552254, + "reward_std": 0.17562847631052136, + "rewards/equation_reward_func": 0.5837053880095482, + "rewards/format_reward_func": 0.9709821864962578, + "step": 272 + }, + { + "completion_length": 286.8727807998657, + "epoch": 0.3409550474412817, + "grad_norm": 0.06418627638571622, + "kl": 0.20733642578125, + "learning_rate": 1.7549195509265407e-07, + "loss": 0.0002, + "reward": 1.373883992433548, + "reward_std": 0.24791530705988407, + "rewards/equation_reward_func": 0.42410716507583857, + "rewards/format_reward_func": 0.9497768171131611, + "step": 274 + }, + { + "completion_length": 266.1897430419922, + "epoch": 0.34344377041530566, + "grad_norm": 0.7673239333850856, + "kl": 0.2283935546875, + "learning_rate": 1.7206079062562536e-07, + "loss": 0.0002, + "reward": 1.45089291036129, + "reward_std": 0.173080294393003, + "rewards/equation_reward_func": 0.4899553805589676, + "rewards/format_reward_func": 0.9609375298023224, + "step": 276 + }, + { + "completion_length": 282.8348331451416, + "epoch": 0.3459324933893296, + "grad_norm": 0.0632244397075646, + "kl": 0.21356201171875, + "learning_rate": 1.6864581199841226e-07, + "loss": 0.0002, + "reward": 1.4174107685685158, + "reward_std": 0.20238550938665867, + "rewards/equation_reward_func": 0.470982164144516, + "rewards/format_reward_func": 0.9464286155998707, + "step": 278 + }, + { + "completion_length": 283.8951015472412, + "epoch": 0.34842121636335355, + "grad_norm": 0.05348187564500839, + "kl": 0.2279052734375, + "learning_rate": 1.6524772840857388e-07, + "loss": 0.0002, + "reward": 1.4040179252624512, + "reward_std": 0.21677289670333266, + "rewards/equation_reward_func": 0.450892873108387, + "rewards/format_reward_func": 0.9531250409781933, + "step": 280 + }, + { + "completion_length": 265.0759038925171, + "epoch": 0.3509099393373775, + "grad_norm": 0.07679910791742155, + "kl": 0.22210693359375, + "learning_rate": 1.6186724554503237e-07, + "loss": 0.0002, + "reward": 1.4330357611179352, + "reward_std": 0.20752421114593744, + "rewards/equation_reward_func": 0.4687500223517418, + "rewards/format_reward_func": 0.9642857499420643, + "step": 282 + }, + { + "completion_length": 284.56363010406494, + "epoch": 0.35339866231140143, + "grad_norm": 0.05732289464788312, + "kl": 0.22857666015625, + "learning_rate": 1.5850506544152103e-07, + "loss": 0.0002, + "reward": 1.4430804178118706, + "reward_std": 0.17447989620268345, + "rewards/equation_reward_func": 0.47321430779993534, + "rewards/format_reward_func": 0.9698661006987095, + "step": 284 + }, + { + "completion_length": 264.10938453674316, + "epoch": 0.3558873852854254, + "grad_norm": 0.04971277203023392, + "kl": 0.22442626953125, + "learning_rate": 1.5516188633079107e-07, + "loss": 0.0002, + "reward": 1.4821429252624512, + "reward_std": 0.19169320166110992, + "rewards/equation_reward_func": 0.5156250260770321, + "rewards/format_reward_func": 0.9665178954601288, + "step": 286 + }, + { + "completion_length": 276.925235748291, + "epoch": 0.3583761082594494, + "grad_norm": 0.05844528789981532, + "kl": 0.21966552734375, + "learning_rate": 1.5183840249960784e-07, + "loss": 0.0002, + "reward": 1.433035783469677, + "reward_std": 0.2321711997501552, + "rewards/equation_reward_func": 0.47991073690354824, + "rewards/format_reward_func": 0.9531250447034836, + "step": 288 + }, + { + "completion_length": 249.3024673461914, + "epoch": 0.36086483123347335, + "grad_norm": 0.04774574092660203, + "kl": 0.225341796875, + "learning_rate": 1.4853530414456612e-07, + "loss": 0.0002, + "reward": 1.5066964998841286, + "reward_std": 0.16551457298919559, + "rewards/equation_reward_func": 0.5357143115252256, + "rewards/format_reward_func": 0.9709821715950966, + "step": 290 + }, + { + "completion_length": 260.86608123779297, + "epoch": 0.36335355420749726, + "grad_norm": 0.050668244719322277, + "kl": 0.212890625, + "learning_rate": 1.4525327722875568e-07, + "loss": 0.0002, + "reward": 1.4709822088479996, + "reward_std": 0.1885156724601984, + "rewards/equation_reward_func": 0.5000000251457095, + "rewards/format_reward_func": 0.9709821678698063, + "step": 292 + }, + { + "completion_length": 285.5926465988159, + "epoch": 0.36584227718152124, + "grad_norm": 0.05273095674745574, + "kl": 0.22235107421875, + "learning_rate": 1.4199300333930515e-07, + "loss": 0.0002, + "reward": 1.4587054178118706, + "reward_std": 0.20572060579434037, + "rewards/equation_reward_func": 0.510044664144516, + "rewards/format_reward_func": 0.9486607499420643, + "step": 294 + }, + { + "completion_length": 301.3437662124634, + "epoch": 0.3683310001555452, + "grad_norm": 0.05580536848172712, + "kl": 0.22265625, + "learning_rate": 1.3875515954583523e-07, + "loss": 0.0002, + "reward": 1.3404018431901932, + "reward_std": 0.18478884501382709, + "rewards/equation_reward_func": 0.3839285899884999, + "rewards/format_reward_func": 0.9564732424914837, + "step": 296 + }, + { + "completion_length": 283.79131031036377, + "epoch": 0.3708197231295691, + "grad_norm": 0.06174432474758232, + "kl": 0.22003173828125, + "learning_rate": 1.3554041825985e-07, + "loss": 0.0002, + "reward": 1.4375000521540642, + "reward_std": 0.20120970671996474, + "rewards/equation_reward_func": 0.47991073224693537, + "rewards/format_reward_func": 0.957589328289032, + "step": 298 + }, + { + "completion_length": 289.1685390472412, + "epoch": 0.3733084461035931, + "grad_norm": 0.0549328940573922, + "kl": 0.23248291015625, + "learning_rate": 1.323494470950949e-07, + "loss": 0.0002, + "reward": 1.36495541036129, + "reward_std": 0.21155750146135688, + "rewards/equation_reward_func": 0.4185268050059676, + "rewards/format_reward_func": 0.9464286118745804, + "step": 300 + }, + { + "completion_length": 267.3917512893677, + "epoch": 0.37579716907761707, + "grad_norm": 0.05147542755960161, + "kl": 0.2188720703125, + "learning_rate": 1.2918290872891236e-07, + "loss": 0.0002, + "reward": 1.4988840073347092, + "reward_std": 0.17496886011213064, + "rewards/equation_reward_func": 0.5368303880095482, + "rewards/format_reward_func": 0.9620536081492901, + "step": 302 + }, + { + "completion_length": 276.30582094192505, + "epoch": 0.378285892051641, + "grad_norm": 0.05300792192239273, + "kl": 0.22711181640625, + "learning_rate": 1.260414607646213e-07, + "loss": 0.0002, + "reward": 1.4486607685685158, + "reward_std": 0.18876845808699727, + "rewards/equation_reward_func": 0.4921875186264515, + "rewards/format_reward_func": 0.9564732387661934, + "step": 304 + }, + { + "completion_length": 266.9196557998657, + "epoch": 0.38077461502566495, + "grad_norm": 0.06514244269360671, + "kl": 0.28143310546875, + "learning_rate": 1.2292575559495143e-07, + "loss": 0.0003, + "reward": 1.4754464775323868, + "reward_std": 0.20895800599828362, + "rewards/equation_reward_func": 0.5245536006987095, + "rewards/format_reward_func": 0.9508928880095482, + "step": 306 + }, + { + "completion_length": 263.41630840301514, + "epoch": 0.3832633379996889, + "grad_norm": 0.0520463127094474, + "kl": 0.2337646484375, + "learning_rate": 1.1983644026655835e-07, + "loss": 0.0002, + "reward": 1.488839365541935, + "reward_std": 0.2131196865811944, + "rewards/equation_reward_func": 0.5234375260770321, + "rewards/format_reward_func": 0.9654018171131611, + "step": 308 + }, + { + "completion_length": 266.73103857040405, + "epoch": 0.38575206097371284, + "grad_norm": 0.052587830849904815, + "kl": 0.22607421875, + "learning_rate": 1.1677415634565066e-07, + "loss": 0.0002, + "reward": 1.4631697088479996, + "reward_std": 0.17361521907150745, + "rewards/equation_reward_func": 0.4944196594879031, + "rewards/format_reward_func": 0.9687500298023224, + "step": 310 + }, + { + "completion_length": 260.9263496398926, + "epoch": 0.3882407839477368, + "grad_norm": 0.05132512982351145, + "kl": 0.2310791015625, + "learning_rate": 1.1373953978475353e-07, + "loss": 0.0002, + "reward": 1.4665179178118706, + "reward_std": 0.19973930763080716, + "rewards/equation_reward_func": 0.5066964514553547, + "rewards/format_reward_func": 0.9598214663565159, + "step": 312 + }, + { + "completion_length": 292.9397449493408, + "epoch": 0.3907295069217608, + "grad_norm": 0.04204105376528588, + "kl": 0.2447509765625, + "learning_rate": 1.1073322079063913e-07, + "loss": 0.0002, + "reward": 1.405133992433548, + "reward_std": 0.1639846209436655, + "rewards/equation_reward_func": 0.4453125223517418, + "rewards/format_reward_func": 0.9598214626312256, + "step": 314 + }, + { + "completion_length": 281.0435390472412, + "epoch": 0.3932182298957847, + "grad_norm": 0.05904069968992011, + "kl": 0.21405029296875, + "learning_rate": 1.0775582369344946e-07, + "loss": 0.0002, + "reward": 1.4185268506407738, + "reward_std": 0.20928293373435736, + "rewards/equation_reward_func": 0.4575893133878708, + "rewards/format_reward_func": 0.9609375298023224, + "step": 316 + }, + { + "completion_length": 282.73438835144043, + "epoch": 0.39570695286980867, + "grad_norm": 0.05546896578155631, + "kl": 0.21636962890625, + "learning_rate": 1.0480796681704077e-07, + "loss": 0.0002, + "reward": 1.4453125596046448, + "reward_std": 0.21966069657355547, + "rewards/equation_reward_func": 0.4910714477300644, + "rewards/format_reward_func": 0.9542411081492901, + "step": 318 + }, + { + "completion_length": 290.85715770721436, + "epoch": 0.39819567584383264, + "grad_norm": 0.051125363447751745, + "kl": 0.217041015625, + "learning_rate": 1.018902623505741e-07, + "loss": 0.0002, + "reward": 1.3772322088479996, + "reward_std": 0.17292431741952896, + "rewards/equation_reward_func": 0.4241071678698063, + "rewards/format_reward_func": 0.953125037252903, + "step": 320 + }, + { + "completion_length": 271.14286708831787, + "epoch": 0.4006843988178566, + "grad_norm": 0.05569159591979702, + "kl": 0.23260498046875, + "learning_rate": 9.900331622138063e-08, + "loss": 0.0002, + "reward": 1.4575893580913544, + "reward_std": 0.19401329522952437, + "rewards/equation_reward_func": 0.49888395611196756, + "rewards/format_reward_func": 0.9587053842842579, + "step": 322 + }, + { + "completion_length": 266.0435380935669, + "epoch": 0.40317312179188053, + "grad_norm": 0.0643989995982714, + "kl": 0.2467041015625, + "learning_rate": 9.614772796912681e-08, + "loss": 0.0002, + "reward": 1.4330357760190964, + "reward_std": 0.1952164708636701, + "rewards/equation_reward_func": 0.47433038242161274, + "rewards/format_reward_func": 0.9587053917348385, + "step": 324 + }, + { + "completion_length": 296.36162281036377, + "epoch": 0.4056618447659045, + "grad_norm": 0.06592474865214347, + "kl": 0.216064453125, + "learning_rate": 9.332409062130686e-08, + "loss": 0.0002, + "reward": 1.4029018506407738, + "reward_std": 0.23388848965987563, + "rewards/equation_reward_func": 0.4464285932481289, + "rewards/format_reward_func": 0.956473246216774, + "step": 326 + }, + { + "completion_length": 265.6294755935669, + "epoch": 0.40815056773992847, + "grad_norm": 0.040286899772741865, + "kl": 0.2259521484375, + "learning_rate": 9.053299057008699e-08, + "loss": 0.0002, + "reward": 1.4832589775323868, + "reward_std": 0.1687624640762806, + "rewards/equation_reward_func": 0.5156250260770321, + "rewards/format_reward_func": 0.9676339663565159, + "step": 328 + }, + { + "completion_length": 247.71653175354004, + "epoch": 0.4106392907139524, + "grad_norm": 0.08330283837230541, + "kl": 0.2242431640625, + "learning_rate": 8.777500745052743e-08, + "loss": 0.0002, + "reward": 1.4609375670552254, + "reward_std": 0.1921851597726345, + "rewards/equation_reward_func": 0.49553573690354824, + "rewards/format_reward_func": 0.9654018171131611, + "step": 330 + }, + { + "completion_length": 258.3069314956665, + "epoch": 0.41312801368797636, + "grad_norm": 0.047241469109823984, + "kl": 0.2232666015625, + "learning_rate": 8.505071402020892e-08, + "loss": 0.0002, + "reward": 1.4441964998841286, + "reward_std": 0.15772674046456814, + "rewards/equation_reward_func": 0.47991072945296764, + "rewards/format_reward_func": 0.964285746216774, + "step": 332 + }, + { + "completion_length": 257.712064743042, + "epoch": 0.41561673666200033, + "grad_norm": 0.05922356243283228, + "kl": 0.21270751953125, + "learning_rate": 8.236067604028562e-08, + "loss": 0.0002, + "reward": 1.4776786491274834, + "reward_std": 0.1794830970466137, + "rewards/equation_reward_func": 0.505580386146903, + "rewards/format_reward_func": 0.9720982536673546, + "step": 334 + }, + { + "completion_length": 261.08929920196533, + "epoch": 0.41810545963602425, + "grad_norm": 0.05512439495800802, + "kl": 0.27520751953125, + "learning_rate": 7.970545215799327e-08, + "loss": 0.0003, + "reward": 1.453125074505806, + "reward_std": 0.17044777097180486, + "rewards/equation_reward_func": 0.482142879627645, + "rewards/format_reward_func": 0.9709821753203869, + "step": 336 + }, + { + "completion_length": 253.13282299041748, + "epoch": 0.4205941826100482, + "grad_norm": 0.0546878420888323, + "kl": 0.23211669921875, + "learning_rate": 7.708559379063204e-08, + "loss": 0.0002, + "reward": 1.4520089998841286, + "reward_std": 0.160722223110497, + "rewards/equation_reward_func": 0.47767859511077404, + "rewards/format_reward_func": 0.9743303954601288, + "step": 338 + }, + { + "completion_length": 268.42523288726807, + "epoch": 0.4230829055840722, + "grad_norm": 0.0643372128173253, + "kl": 0.24578857421875, + "learning_rate": 7.45016450110534e-08, + "loss": 0.0002, + "reward": 1.392857201397419, + "reward_std": 0.15963875455781817, + "rewards/equation_reward_func": 0.4263393054716289, + "rewards/format_reward_func": 0.9665178842842579, + "step": 340 + }, + { + "completion_length": 289.94197940826416, + "epoch": 0.4255716285580961, + "grad_norm": 0.12614189846940307, + "kl": 0.35626220703125, + "learning_rate": 7.195414243467029e-08, + "loss": 0.0004, + "reward": 1.3549107909202576, + "reward_std": 0.1969244135543704, + "rewards/equation_reward_func": 0.3962053820723668, + "rewards/format_reward_func": 0.9587053880095482, + "step": 342 + }, + { + "completion_length": 259.41407203674316, + "epoch": 0.4280603515321201, + "grad_norm": 0.054571007367345555, + "kl": 0.21270751953125, + "learning_rate": 6.944361510801763e-08, + "loss": 0.0002, + "reward": 1.4241072088479996, + "reward_std": 0.1726059396751225, + "rewards/equation_reward_func": 0.4620535969734192, + "rewards/format_reward_func": 0.9620536118745804, + "step": 344 + }, + { + "completion_length": 255.23326969146729, + "epoch": 0.43054907450614405, + "grad_norm": 0.07334212596865244, + "kl": 0.220703125, + "learning_rate": 6.697058439888283e-08, + "loss": 0.0002, + "reward": 1.4832589849829674, + "reward_std": 0.17638651933521032, + "rewards/equation_reward_func": 0.5167411025613546, + "rewards/format_reward_func": 0.9665178842842579, + "step": 346 + }, + { + "completion_length": 272.0904130935669, + "epoch": 0.43303779748016796, + "grad_norm": 0.0639218845007823, + "kl": 0.216064453125, + "learning_rate": 6.453556388803288e-08, + "loss": 0.0002, + "reward": 1.4542411491274834, + "reward_std": 0.21514991857111454, + "rewards/equation_reward_func": 0.4888393050059676, + "rewards/format_reward_func": 0.9654018208384514, + "step": 348 + }, + { + "completion_length": 246.30581283569336, + "epoch": 0.43552652045419193, + "grad_norm": 0.0840915601049537, + "kl": 0.2225341796875, + "learning_rate": 6.213905926255697e-08, + "loss": 0.0002, + "reward": 1.5279018580913544, + "reward_std": 0.18220655526965857, + "rewards/equation_reward_func": 0.5647321715950966, + "rewards/format_reward_func": 0.9631696790456772, + "step": 350 + }, + { + "completion_length": 258.50113010406494, + "epoch": 0.4380152434282159, + "grad_norm": 0.05057611458509387, + "kl": 0.2137451171875, + "learning_rate": 5.978156821084987e-08, + "loss": 0.0002, + "reward": 1.4654018357396126, + "reward_std": 0.1536577446386218, + "rewards/equation_reward_func": 0.49888394959270954, + "rewards/format_reward_func": 0.9665178917348385, + "step": 352 + }, + { + "completion_length": 246.66184329986572, + "epoch": 0.4405039664022399, + "grad_norm": 0.055435192319033814, + "kl": 0.2176513671875, + "learning_rate": 5.7463580319254853e-08, + "loss": 0.0002, + "reward": 1.4687500670552254, + "reward_std": 0.17097870633006096, + "rewards/equation_reward_func": 0.49553573597222567, + "rewards/format_reward_func": 0.9732143245637417, + "step": 354 + }, + { + "completion_length": 250.23550128936768, + "epoch": 0.4429926893762638, + "grad_norm": 0.04991979968995625, + "kl": 0.21051025390625, + "learning_rate": 5.518557697039081e-08, + "loss": 0.0002, + "reward": 1.4944197088479996, + "reward_std": 0.18009533546864986, + "rewards/equation_reward_func": 0.520089304074645, + "rewards/format_reward_func": 0.9743303768336773, + "step": 356 + }, + { + "completion_length": 255.1149673461914, + "epoch": 0.44548141235028776, + "grad_norm": 0.05353950405443061, + "kl": 0.20758056640625, + "learning_rate": 5.294803124318145e-08, + "loss": 0.0002, + "reward": 1.468750074505806, + "reward_std": 0.18782880948856473, + "rewards/equation_reward_func": 0.5044643077999353, + "rewards/format_reward_func": 0.9642857573926449, + "step": 358 + }, + { + "completion_length": 255.90067958831787, + "epoch": 0.44797013532431174, + "grad_norm": 0.05725118559311897, + "kl": 0.21295166015625, + "learning_rate": 5.07514078146106e-08, + "loss": 0.0002, + "reward": 1.4464286267757416, + "reward_std": 0.18124625319615006, + "rewards/equation_reward_func": 0.4810268124565482, + "rewards/format_reward_func": 0.9654018320143223, + "step": 360 + }, + { + "completion_length": 262.5714416503906, + "epoch": 0.45045885829833565, + "grad_norm": 0.06839221438705215, + "kl": 0.22894287109375, + "learning_rate": 4.859616286322094e-08, + "loss": 0.0002, + "reward": 1.4352679252624512, + "reward_std": 0.19061506912112236, + "rewards/equation_reward_func": 0.4776785938302055, + "rewards/format_reward_func": 0.9575893208384514, + "step": 362 + }, + { + "completion_length": 270.0591630935669, + "epoch": 0.4529475812723596, + "grad_norm": 0.06771361462731067, + "kl": 0.23846435546875, + "learning_rate": 4.648274397437829e-08, + "loss": 0.0002, + "reward": 1.4241072088479996, + "reward_std": 0.1951315077021718, + "rewards/equation_reward_func": 0.46428574062883854, + "rewards/format_reward_func": 0.9598214626312256, + "step": 364 + }, + { + "completion_length": 244.5680913925171, + "epoch": 0.4554363042463836, + "grad_norm": 0.06570494423275842, + "kl": 0.22015380859375, + "learning_rate": 4.4411590047320617e-08, + "loss": 0.0002, + "reward": 1.5491072162985802, + "reward_std": 0.17699437169358134, + "rewards/equation_reward_func": 0.5714285969734192, + "rewards/format_reward_func": 0.9776785932481289, + "step": 366 + }, + { + "completion_length": 258.7991189956665, + "epoch": 0.4579250272204075, + "grad_norm": 0.0720114335252616, + "kl": 0.2042236328125, + "learning_rate": 4.2383131204010494e-08, + "loss": 0.0002, + "reward": 1.4709822088479996, + "reward_std": 0.19236048124730587, + "rewards/equation_reward_func": 0.5066964570432901, + "rewards/format_reward_func": 0.9642857387661934, + "step": 368 + }, + { + "completion_length": 256.76228618621826, + "epoch": 0.4604137501944315, + "grad_norm": 0.051725385509834826, + "kl": 0.22265625, + "learning_rate": 4.039778869981064e-08, + "loss": 0.0002, + "reward": 1.4776786416769028, + "reward_std": 0.18397637410089374, + "rewards/equation_reward_func": 0.5022321697324514, + "rewards/format_reward_func": 0.975446455180645, + "step": 370 + }, + { + "completion_length": 266.7600574493408, + "epoch": 0.46290247316845545, + "grad_norm": 0.059635161912602624, + "kl": 0.21502685546875, + "learning_rate": 3.845597483600049e-08, + "loss": 0.0002, + "reward": 1.402901865541935, + "reward_std": 0.18843654869124293, + "rewards/equation_reward_func": 0.4441964514553547, + "rewards/format_reward_func": 0.9587053880095482, + "step": 372 + }, + { + "completion_length": 269.5904130935669, + "epoch": 0.46539119614247937, + "grad_norm": 0.052058607348838166, + "kl": 0.239990234375, + "learning_rate": 3.655809287415284e-08, + "loss": 0.0002, + "reward": 1.4475447162985802, + "reward_std": 0.18611292028799653, + "rewards/equation_reward_func": 0.47879466973245144, + "rewards/format_reward_func": 0.9687500335276127, + "step": 374 + }, + { + "completion_length": 261.80804920196533, + "epoch": 0.46787991911650334, + "grad_norm": 0.05654912472263546, + "kl": 0.21923828125, + "learning_rate": 3.4704536952387285e-08, + "loss": 0.0002, + "reward": 1.4296875596046448, + "reward_std": 0.19141265889629722, + "rewards/equation_reward_func": 0.4676339477300644, + "rewards/format_reward_func": 0.9620536044239998, + "step": 376 + }, + { + "completion_length": 257.9151906967163, + "epoch": 0.4703686420905273, + "grad_norm": 0.05359040211565284, + "kl": 0.22039794921875, + "learning_rate": 3.2895692003518575e-08, + "loss": 0.0002, + "reward": 1.4352679178118706, + "reward_std": 0.2002840624190867, + "rewards/equation_reward_func": 0.4787946715950966, + "rewards/format_reward_func": 0.9564732499420643, + "step": 378 + }, + { + "completion_length": 252.555814743042, + "epoch": 0.4728573650645512, + "grad_norm": 0.05665983443995847, + "kl": 0.23614501953125, + "learning_rate": 3.113193367511635e-08, + "loss": 0.0002, + "reward": 1.4587054252624512, + "reward_std": 0.18507013376802206, + "rewards/equation_reward_func": 0.4955357387661934, + "rewards/format_reward_func": 0.9631696715950966, + "step": 380 + }, + { + "completion_length": 246.92746829986572, + "epoch": 0.4753460880385752, + "grad_norm": 0.05986371207599387, + "kl": 0.2442626953125, + "learning_rate": 2.9413628251493934e-08, + "loss": 0.0002, + "reward": 1.487723283469677, + "reward_std": 0.15949935605749488, + "rewards/equation_reward_func": 0.5234375260770321, + "rewards/format_reward_func": 0.9642857499420643, + "step": 382 + }, + { + "completion_length": 264.3817071914673, + "epoch": 0.47783481101259917, + "grad_norm": 0.05453811145707849, + "kl": 0.2188720703125, + "learning_rate": 2.774113257764066e-08, + "loss": 0.0002, + "reward": 1.434151865541935, + "reward_std": 0.18349733110517263, + "rewards/equation_reward_func": 0.47656252048909664, + "rewards/format_reward_func": 0.9575893171131611, + "step": 384 + }, + { + "completion_length": 245.20536708831787, + "epoch": 0.48032353398662314, + "grad_norm": 0.05552843745329939, + "kl": 0.22064208984375, + "learning_rate": 2.611479398511518e-08, + "loss": 0.0002, + "reward": 1.4899554327130318, + "reward_std": 0.1519217761233449, + "rewards/equation_reward_func": 0.5145089514553547, + "rewards/format_reward_func": 0.9754464626312256, + "step": 386 + }, + { + "completion_length": 269.5904140472412, + "epoch": 0.48281225696064706, + "grad_norm": 0.05743635058931217, + "kl": 0.2388916015625, + "learning_rate": 2.4534950219914057e-08, + "loss": 0.0002, + "reward": 1.4185268357396126, + "reward_std": 0.19744081050157547, + "rewards/equation_reward_func": 0.44419645238667727, + "rewards/format_reward_func": 0.9743303842842579, + "step": 388 + }, + { + "completion_length": 233.9810390472412, + "epoch": 0.48530097993467103, + "grad_norm": 0.060693747477844985, + "kl": 0.2197265625, + "learning_rate": 2.300192937233128e-08, + "loss": 0.0002, + "reward": 1.5803572162985802, + "reward_std": 0.16287201223894954, + "rewards/equation_reward_func": 0.6093750288709998, + "rewards/format_reward_func": 0.970982164144516, + "step": 390 + }, + { + "completion_length": 257.4933156967163, + "epoch": 0.487789702908695, + "grad_norm": 0.061473806975209856, + "kl": 0.2171630859375, + "learning_rate": 2.1516049808822935e-08, + "loss": 0.0002, + "reward": 1.4687500596046448, + "reward_std": 0.18804124649614096, + "rewards/equation_reward_func": 0.505580386146903, + "rewards/format_reward_func": 0.9631696790456772, + "step": 392 + }, + { + "completion_length": 266.17189025878906, + "epoch": 0.4902784258827189, + "grad_norm": 0.057251931052709155, + "kl": 0.2237548828125, + "learning_rate": 2.007762010589098e-08, + "loss": 0.0002, + "reward": 1.4062500596046448, + "reward_std": 0.16503014508634806, + "rewards/equation_reward_func": 0.43638394586741924, + "rewards/format_reward_func": 0.9698661044239998, + "step": 394 + }, + { + "completion_length": 288.45872020721436, + "epoch": 0.4927671488567429, + "grad_norm": 0.05683738580050447, + "kl": 0.22113037109375, + "learning_rate": 1.8686938986000627e-08, + "loss": 0.0002, + "reward": 1.3292411267757416, + "reward_std": 0.17618125723674893, + "rewards/equation_reward_func": 0.3705357308499515, + "rewards/format_reward_func": 0.9587053880095482, + "step": 396 + }, + { + "completion_length": 274.2555932998657, + "epoch": 0.49525587183076686, + "grad_norm": 0.05631696950465828, + "kl": 0.2208251953125, + "learning_rate": 1.734429525554365e-08, + "loss": 0.0002, + "reward": 1.4140625670552254, + "reward_std": 0.1975519866682589, + "rewards/equation_reward_func": 0.4520089467987418, + "rewards/format_reward_func": 0.9620536006987095, + "step": 398 + }, + { + "completion_length": 245.83148384094238, + "epoch": 0.4977445948047908, + "grad_norm": 0.05014202042525302, + "kl": 0.2230224609375, + "learning_rate": 1.604996774486145e-08, + "loss": 0.0002, + "reward": 1.4866072088479996, + "reward_std": 0.16337728220969439, + "rewards/equation_reward_func": 0.5212053786963224, + "rewards/format_reward_func": 0.9654018171131611, + "step": 400 + }, + { + "completion_length": 253.30804443359375, + "epoch": 0.5002333177788147, + "grad_norm": 0.060614389948920294, + "kl": 0.22021484375, + "learning_rate": 1.4804225250339281e-08, + "loss": 0.0002, + "reward": 1.4687500670552254, + "reward_std": 0.1655928883701563, + "rewards/equation_reward_func": 0.502232164144516, + "rewards/format_reward_func": 0.9665178805589676, + "step": 402 + }, + { + "completion_length": 268.2712173461914, + "epoch": 0.5027220407528387, + "grad_norm": 0.06043605047844046, + "kl": 0.21038818359375, + "learning_rate": 1.360732647858498e-08, + "loss": 0.0002, + "reward": 1.4419643506407738, + "reward_std": 0.18442421313375235, + "rewards/equation_reward_func": 0.486607164144516, + "rewards/format_reward_func": 0.9553571753203869, + "step": 404 + }, + { + "completion_length": 256.667423248291, + "epoch": 0.5052107637268627, + "grad_norm": 0.03748084182110105, + "kl": 0.21240234375, + "learning_rate": 1.2459519992702311e-08, + "loss": 0.0002, + "reward": 1.4732143580913544, + "reward_std": 0.11906880373135209, + "rewards/equation_reward_func": 0.4910714514553547, + "rewards/format_reward_func": 0.9821428842842579, + "step": 406 + }, + { + "completion_length": 236.2924222946167, + "epoch": 0.5076994867008866, + "grad_norm": 0.0629615161229278, + "kl": 0.22723388671875, + "learning_rate": 1.1361044160671629e-08, + "loss": 0.0002, + "reward": 1.5323661491274834, + "reward_std": 0.17991887778043747, + "rewards/equation_reward_func": 0.5647321660071611, + "rewards/format_reward_func": 0.9676339589059353, + "step": 408 + }, + { + "completion_length": 267.2890729904175, + "epoch": 0.5101882096749105, + "grad_norm": 0.08454099786217265, + "kl": 0.21246337890625, + "learning_rate": 1.0312127105846947e-08, + "loss": 0.0002, + "reward": 1.3917411416769028, + "reward_std": 0.200666856020689, + "rewards/equation_reward_func": 0.42857144866138697, + "rewards/format_reward_func": 0.9631696864962578, + "step": 410 + }, + { + "completion_length": 241.93639659881592, + "epoch": 0.5126769326489345, + "grad_norm": 0.05678911579880298, + "kl": 0.2169189453125, + "learning_rate": 9.312986659581301e-09, + "loss": 0.0002, + "reward": 1.5145090073347092, + "reward_std": 0.18534906907007098, + "rewards/equation_reward_func": 0.5435268152505159, + "rewards/format_reward_func": 0.970982164144516, + "step": 412 + }, + { + "completion_length": 262.33148670196533, + "epoch": 0.5151656556229585, + "grad_norm": 0.07237569221975489, + "kl": 0.2265625, + "learning_rate": 8.363830315988945e-09, + "loss": 0.0002, + "reward": 1.4308036416769028, + "reward_std": 0.18102896073833108, + "rewards/equation_reward_func": 0.4799107415601611, + "rewards/format_reward_func": 0.9508928880095482, + "step": 414 + }, + { + "completion_length": 290.8247900009155, + "epoch": 0.5176543785969824, + "grad_norm": 0.06291574216632526, + "kl": 0.211181640625, + "learning_rate": 7.46485518885462e-09, + "loss": 0.0002, + "reward": 1.3325893431901932, + "reward_std": 0.2226958447135985, + "rewards/equation_reward_func": 0.3828125229338184, + "rewards/format_reward_func": 0.9497768133878708, + "step": 416 + }, + { + "completion_length": 250.63059425354004, + "epoch": 0.5201431015710064, + "grad_norm": 0.06285425713534079, + "kl": 0.2586669921875, + "learning_rate": 6.616247970698319e-09, + "loss": 0.0003, + "reward": 1.4854911491274834, + "reward_std": 0.17498166300356388, + "rewards/equation_reward_func": 0.5156250260770321, + "rewards/format_reward_func": 0.9698660969734192, + "step": 418 + }, + { + "completion_length": 256.33260345458984, + "epoch": 0.5226318245450303, + "grad_norm": 0.05299668721681115, + "kl": 0.21307373046875, + "learning_rate": 5.8181848940044855e-09, + "loss": 0.0002, + "reward": 1.4241072088479996, + "reward_std": 0.2053914200514555, + "rewards/equation_reward_func": 0.4631696604192257, + "rewards/format_reward_func": 0.9609375223517418, + "step": 420 + }, + { + "completion_length": 251.9442081451416, + "epoch": 0.5251205475190542, + "grad_norm": 0.03956351552241899, + "kl": 0.26885986328125, + "learning_rate": 5.070831694623135e-09, + "loss": 0.0003, + "reward": 1.4899554327130318, + "reward_std": 0.13848364166915417, + "rewards/equation_reward_func": 0.5200893077999353, + "rewards/format_reward_func": 0.9698661006987095, + "step": 422 + }, + { + "completion_length": 256.5011262893677, + "epoch": 0.5276092704930783, + "grad_norm": 0.0943308246377347, + "kl": 0.21270751953125, + "learning_rate": 4.374343577351336e-09, + "loss": 0.0002, + "reward": 1.4866072162985802, + "reward_std": 0.22044320311397314, + "rewards/equation_reward_func": 0.5212053824216127, + "rewards/format_reward_func": 0.9654018171131611, + "step": 424 + }, + { + "completion_length": 263.80693340301514, + "epoch": 0.5300979934671022, + "grad_norm": 0.06623549471839515, + "kl": 0.2095947265625, + "learning_rate": 3.7288651837012745e-09, + "loss": 0.0002, + "reward": 1.4475447311997414, + "reward_std": 0.18339544022455812, + "rewards/equation_reward_func": 0.47879466228187084, + "rewards/format_reward_func": 0.968750037252903, + "step": 426 + }, + { + "completion_length": 268.9073781967163, + "epoch": 0.5325867164411261, + "grad_norm": 0.052449792813201314, + "kl": 0.2080078125, + "learning_rate": 3.134530561862081e-09, + "loss": 0.0002, + "reward": 1.392857201397419, + "reward_std": 0.19783430639654398, + "rewards/equation_reward_func": 0.43415180779993534, + "rewards/format_reward_func": 0.9587053880095482, + "step": 428 + }, + { + "completion_length": 280.67747020721436, + "epoch": 0.5350754394151501, + "grad_norm": 0.08827545780059727, + "kl": 0.21624755859375, + "learning_rate": 2.5914631388619103e-09, + "loss": 0.0002, + "reward": 1.3750000447034836, + "reward_std": 0.18710578652098775, + "rewards/equation_reward_func": 0.4140625229338184, + "rewards/format_reward_func": 0.960937537252903, + "step": 430 + }, + { + "completion_length": 264.04130840301514, + "epoch": 0.537564162389174, + "grad_norm": 0.053078250209355325, + "kl": 0.21514892578125, + "learning_rate": 2.0997756949353297e-09, + "loss": 0.0002, + "reward": 1.4620536267757416, + "reward_std": 0.16093172412365675, + "rewards/equation_reward_func": 0.4977678833529353, + "rewards/format_reward_func": 0.9642857499420643, + "step": 432 + }, + { + "completion_length": 278.2064847946167, + "epoch": 0.540052885363198, + "grad_norm": 0.07760000928814792, + "kl": 0.21234130859375, + "learning_rate": 1.6595703401020844e-09, + "loss": 0.0002, + "reward": 1.3883929252624512, + "reward_std": 0.2151358723640442, + "rewards/equation_reward_func": 0.4341518059372902, + "rewards/format_reward_func": 0.9542410969734192, + "step": 434 + }, + { + "completion_length": 264.3091688156128, + "epoch": 0.542541608337222, + "grad_norm": 0.05086715788627145, + "kl": 0.21771240234375, + "learning_rate": 1.2709384929615596e-09, + "loss": 0.0002, + "reward": 1.437500074505806, + "reward_std": 0.1830471744760871, + "rewards/equation_reward_func": 0.47098216507583857, + "rewards/format_reward_func": 0.9665178842842579, + "step": 436 + }, + { + "completion_length": 254.76452159881592, + "epoch": 0.5450303313112459, + "grad_norm": 0.06208573799074421, + "kl": 0.22509765625, + "learning_rate": 9.339608617077165e-10, + "loss": 0.0002, + "reward": 1.4921875819563866, + "reward_std": 0.19756911788135767, + "rewards/equation_reward_func": 0.5323660969734192, + "rewards/format_reward_func": 0.9598214700818062, + "step": 438 + }, + { + "completion_length": 268.79241943359375, + "epoch": 0.5475190542852699, + "grad_norm": 0.04727521654296364, + "kl": 0.23455810546875, + "learning_rate": 6.487074273681114e-10, + "loss": 0.0002, + "reward": 1.4497768580913544, + "reward_std": 0.22120195254683495, + "rewards/equation_reward_func": 0.4877232424914837, + "rewards/format_reward_func": 0.9620535969734192, + "step": 440 + }, + { + "completion_length": 258.01563453674316, + "epoch": 0.5500077772592938, + "grad_norm": 0.05943481158821016, + "kl": 0.23046875, + "learning_rate": 4.152374292708538e-10, + "loss": 0.0002, + "reward": 1.4107143580913544, + "reward_std": 0.1552983969449997, + "rewards/equation_reward_func": 0.44754466600716114, + "rewards/format_reward_func": 0.9631696790456772, + "step": 442 + }, + { + "completion_length": 259.3951025009155, + "epoch": 0.5524965002333178, + "grad_norm": 0.0527539277018196, + "kl": 0.2109375, + "learning_rate": 2.3359935274214204e-10, + "loss": 0.0002, + "reward": 1.4654018431901932, + "reward_std": 0.18068964406847954, + "rewards/equation_reward_func": 0.49776788614690304, + "rewards/format_reward_func": 0.9676339626312256, + "step": 444 + }, + { + "completion_length": 252.39510250091553, + "epoch": 0.5549852232073418, + "grad_norm": 0.05940159867969958, + "kl": 0.21868896484375, + "learning_rate": 1.0383091903720665e-10, + "loss": 0.0002, + "reward": 1.4497768506407738, + "reward_std": 0.18734711268916726, + "rewards/equation_reward_func": 0.4743303842842579, + "rewards/format_reward_func": 0.9754464626312256, + "step": 446 + }, + { + "completion_length": 253.82255363464355, + "epoch": 0.5574739461813657, + "grad_norm": 0.060085523030670523, + "kl": 0.220458984375, + "learning_rate": 2.595907750671533e-11, + "loss": 0.0002, + "reward": 1.4587054401636124, + "reward_std": 0.1627471437677741, + "rewards/equation_reward_func": 0.48214288242161274, + "rewards/format_reward_func": 0.976562537252903, + "step": 448 + }, + { + "completion_length": 261.6841678619385, + "epoch": 0.5599626691553896, + "grad_norm": 0.06873722690901284, + "kl": 0.2308349609375, + "learning_rate": 0.0, + "loss": 0.0002, + "reward": 1.4330357909202576, + "reward_std": 0.2197583164088428, + "rewards/equation_reward_func": 0.4743303870782256, + "rewards/format_reward_func": 0.9587053917348385, + "step": 450 + }, + { + "epoch": 0.5599626691553896, + "step": 450, + "total_flos": 0.0, + "train_loss": 0.00020639907060823268, + "train_runtime": 22455.4825, + "train_samples_per_second": 1.122, + "train_steps_per_second": 0.02 + } + ], + "logging_steps": 2, + "max_steps": 450, + "num_input_tokens_seen": 0, + "num_train_epochs": 1, + "save_steps": 25, + "stateful_callbacks": { + "TrainerControl": { + "args": { + "should_epoch_stop": false, + "should_evaluate": false, + "should_log": false, + "should_save": true, + "should_training_stop": true + }, + "attributes": {} + } + }, + "total_flos": 0.0, + "train_batch_size": 1, + "trial_name": null, + "trial_params": null +}