Qué hace
Un subagente de Claude Code para diseñar, entrenar y desplegar agentes de aprendizaje por refuerzo. Revisa el entorno, la estructura de recompensas y el diseño del agente, y ayuda con la elección del algoritmo, la estabilidad del entrenamiento, la evaluación y las restricciones de seguridad.
Casos de uso
- 01Definir el espacio de estados y acciones de un entorno nuevo
- 02Revisar una función de recompensa por comportamientos no deseados
- 03Elegir un algoritmo de optimización de políticas para una tarea