✍️ Blog

KI-Agenten trainieren in isolierten Sandbox-Umgebungen

15. August 2026·Quelle: Hugging Face Blog

Hugging Face hat eine neue Methode entwickelt, um Programmier-Agenten direkt in ihren eigenen Ausführungsumgebungen zu trainieren. Das System nutzt OpenEnv und TRL, um Agenten wie OpenCode in isolierten Sandboxes laufen zu lassen und anschließend auf den tatsächlich produzierten Token zu trainieren – ohne die Loop selbst nachzufahren.

Der Schlüssel des Ansatzes ist das "Loop-Owning"-Prinzip: Während klassisches Reinforcement Learning den Trainer die Agenten-Schleifen steuern lässt, lädt das neue System den Agenten, seine Schleife eigenständig auszuführen. Ein transparenter Proxy erfasst dabei jeden API-Aufruf und die exakten Token mit ihren Wahrscheinlichkeiten. Das Trainings-Framework AsyncGRPO lernt dann auf Basis dieser echten Produktions-Token – nicht auf nachträglich errechneten Approximationen.

Die Architektur ist agent-unabhängig: Jeder Agent, der in einem Sandbox läuft und über eine API wie OpenAI-kompatible Chat-Completions mit dem Sprachmodell kommuniziert, kann nach diesem Muster trainiert werden. Hugging Face bietet das System bereits in ihren Jobs an und ermöglicht so verteiltes Training über mehrere Remote-Sandboxes hinweg.

Unsere Einordnung

Das Loop-Owning-Konzept adressiert ein fundamentales Problem des Agent-Trainings: Bisher trainierte man auf simulierten Versionen der Agent-Loop, nicht auf den realen Tokens des produktiven Systems. Hugging Face' Lösung könnte die Lücke zwischen Trainings- und Produktionsumgebung deutlich verkleinern und damit die Effektivität von Agent-Feintuning erheblich steigern – ein wichtiger Schritt, um Agenten zuverlässiger und robuster zu machen.

Schlüsselfakten

  • TRL unterstützt jetzt natives Training von Code-Agenten mit OpenEnv und der OpenCode-Harness
  • Loop-Owning: Der Agent läuft seine Schleife selbstständig, während TRL die Tokens aufzeichnet und trainiert
  • Ein transparenter Proxy erfasst alle API-Aufrufe mit exakten Token-IDs und Wahrscheinlichkeitslogits
  • Jeder Rollout läuft in seiner eigenen Remote-Sandbox für skaliertes Training über Hugging Face Jobs
  • Der Ansatz ist agent-unabhängig: Funktioniert mit jedem Agenten, der über OpenAI-kompatible APIs kommuniziert

Artikel teilen