1 article tagged “reinforcement-learning”, most recent first.
A token-handling mistake in multi-turn RL can silently corrupt gradients when models call tools mid-rollout.