Hugging Face hat eine neue Methode entwickelt, um Programmier-Agenten direkt in ihren eigenen Ausführungsumgebungen zu trainieren. Das System nutzt OpenEnv und TRL, um Agenten wie OpenCode in isolierten Sandboxes laufen zu lassen und anschließend auf den tatsächlich produzierten Token zu trainieren – ohne die Loop selbst nachzufahren.
Der Schlüssel des Ansatzes ist das "Loop-Owning"-Prinzip: Während klassisches Reinforcement Learning den Trainer die Agenten-Schleifen steuern lässt, lädt das neue System den Agenten, seine Schleife eigenständig auszuführen. Ein transparenter Proxy erfasst dabei jeden API-Aufruf und die exakten Token mit ihren Wahrscheinlichkeiten. Das Trainings-Framework AsyncGRPO lernt dann auf Basis dieser echten Produktions-Token – nicht auf nachträglich errechneten Approximationen.
Die Architektur ist agent-unabhängig: Jeder Agent, der in einem Sandbox läuft und über eine API wie OpenAI-kompatible Chat-Completions mit dem Sprachmodell kommuniziert, kann nach diesem Muster trainiert werden. Hugging Face bietet das System bereits in ihren Jobs an und ermöglicht so verteiltes Training über mehrere Remote-Sandboxes hinweg.