CFPO_Models RavenInJuly/CFPO-D-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 16 RavenInJuly/CFPO-G-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 19
CFPO CFPO: Counterfactual Policy Optimization for Multimodal Reasoning Paper • 2606.23206 • Published Jun 22 RavenInJuly/CFPO-G-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 19 RavenInJuly/CFPO-D-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 16 RavenInJuly/CFPO_Datasets Preview • Updated Jul 5 • 134
CFPO: Counterfactual Policy Optimization for Multimodal Reasoning Paper • 2606.23206 • Published Jun 22
CFPO_Models RavenInJuly/CFPO-D-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 16 RavenInJuly/CFPO-G-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 19
CFPO CFPO: Counterfactual Policy Optimization for Multimodal Reasoning Paper • 2606.23206 • Published Jun 22 RavenInJuly/CFPO-G-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 19 RavenInJuly/CFPO-D-Qwen2.5-VL-3B Reinforcement Learning • 4B • Updated Jul 5 • 16 RavenInJuly/CFPO_Datasets Preview • Updated Jul 5 • 134
CFPO: Counterfactual Policy Optimization for Multimodal Reasoning Paper • 2606.23206 • Published Jun 22