AMIR-GRPO: Inducing Implicit Preference Signals into GRPOPublished in MathNLP @ EMNLP 2026, 2026Share on Bluesky Facebook LinkedIn X (formerly Twitter) Previous Next