circuito real: estado del motor (JSON) → prompt con atlas,
tipos y diario → el modelo genera la accion token a token → el JUEGO
verifica (¿cambio la huella?) → solo los aciertos entrenan al alumno
(LoRA sobre Qwen3-0.6B, en la RTX 5090 local).
el alumno por dentro — Qwen3-0.6B, 28 capas
transformer; en verde, los adaptadores LoRA r16 (solo si existen)
última decisión real (del log de la
partida)
curva de aprendizaje real (perdida por paso,
todas las tandas en la 5090)
destilación del alumno — qué entrena, cuándo
toca la próxima tanda y a qué ritmo llega material