Last released Oct 28, 2025
A simple utility function for Reinforcement Learning, like the Q-learning update rule.
Supported by