Q-Learning with Scalar Adjoint Matching
Researchers propose adjoint matching to fine-tune flow policies with off-policy reinforcement learning against learned value functions.
Researchers propose adjoint matching to fine-tune flow policies with off-policy reinforcement learning against learned value functions.