[PL] OpenForgeRL — wreszcie można trenować agenty AI z RL w dowolnym środowisku

OpenForgeRL pozwala trenować agenty AI z RL w dowolnym środowisku — bez prompt-engineering, bez ręcznego nadawania trajektorii. To jedna z najważniejszych prac naukowych tygodnia z chińskiej sceny AI dla każdego, kto buduje agentów.


Problem: trenowanie agentów wymaga zbyt dużo ingerencji w proces

Nowoczesne agenty AI — Claude Code, Codex, OpenClaw, a nawet Hermes Agent — używają złożonych środowisk wspierających: wieloetapowych pętli myślenie → wywołanie narzędzia → obserwacja → myślenie. Problem w tym, że żaden otwarty stack RL/SFT nie wspiera tego natywnie.

Standardowe narzędzia (TRL, OpenRLHF, veRL) zakładają prostą sekwencję: prompt → odpowiedź → nagroda. Tymczasem agent robi 5-20 kroków, woła API, czyta pliki, wykonuje kod. Każdy krok zmienia stan środowiska. Próba trenowania tego przez istniejące frameworki kończy się:

  • ręcznym nastawianiem trajektorii w JSONL
  • żmudnym prompt engineeringiem zamiast faktycznego uczenia
  • rezygnacją z RL na rzecz SFT na statycznych zbiorach danych

Autorzy OpenForgeRL — Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou — mówią wprost: “elaborate inference harnesses make agents hard to train end-to-end with open infrastructure”. I proponują rozwiązanie.

Jak działa OpenForgeRL

Architektura opiera się na trzech warstwach:

  1. Environment Abstraction Layer (EAL) — jednolity interfejs do dowolnego środowiska (terminal, API, przeglądarka, gra). Każde środowisko wystawia te same interfejsy: reset(), step(action) → observation, reward, done. Agent nie widzi różnicy między pracą w bashu a graniem w Minecrafta.
  2. Harness-Native Policy — polityka RL zaprojektowana jako część środowiska wspierającego, a nie osobny komponent. Model generuje nie tylko odpowiedź, ale całą sekwencję: [think] → [tool_call] → [observe] → [think] → ... → [final_answer]. Każdy krok to osobna sekwencja tokenów w odpowiedzi, z własnym gradientem.
  3. Multi-Turn PPO / GRPO — adaptacja PPO i GRPO do wieloetapowych inferencji. Kluczowa modyfikacja: funkcja wzmocnienia nie jest liczona po całej trajektorii, ale per-krok, z poprawką gamma. To pozwala modelowi nauczyć się, które poszczególne akcje (np. “sprawdź plik zanim odpowiesz”) są wartościowe, nawet jeśli końcowa odpowiedź jest błędna.
# Pseudokod: trening agenta z OpenForgeRL
env = TerminalEnvironment(cwd="/project")
agent = HarnessPolicy(model="Qwen3.6-8B", harness="codex-style")
trainer = MultiTurnPPO(gamma=0.95, lam=0.95)

for episode in range(1000):
    obs = env.reset()
    trajectory = []
    while not done:
        action = agent.act(obs)          # [think] [tool_call] ...
        obs, reward, done = env.step(action)
        trajectory.append((obs, action, reward))
    trainer.update(trajectory)
    # agent uczy się: wcześnie sprawdzać błędy,
    # nie nadużywać tooli, planować kroki naprzód

Wyniki

Autorzy testowali OpenForgeRL w trzech benchmarkach agentowych:

  • SWE-bench Verified (naprawa bugów w repozytoriach Pythona): +12.3 p.p. ponad SFT baseline, +5.1 p.p. ponad vanilla PPO
  • WebArena (nawigacja po stronach): +8.7 p.p. ponad SFT
  • ToolBench (tool calling, 4 środowiska): +14.2 p.p. ponad SFT, szczególnie w kategorii “multiple tools in sequence”

Co ważne — model 8B trenowany OpenForgeRL dorównuje na SWE-bench modelowi 32B trenowanemu vanilla SFT. To czterokrotna redukcja kosztu inferencji za tę samą jakość(!)

Co to znaczy dla inżyniera

Jeśli budujesz agenta (IDE assistant, CLI agent, web scraper, devops pipeline), OpenForgeRL zmienia reguły gry:

  • Nie musisz przeginać ze zbiorami danych. Agent sam generuje trajektorie w środowisku, dostaje nagrodę (czy zadanie wykonane) i uczy się na własnych błędach.
  • Możesz trenować w dowolnym środowisku. Terminal, API, przeglądarka — EAL jest elastyczny i agnostyczny.
  • RL > prompt engineering. Zamiast spędzać tygodnie na szukaniu magicznego prompta, puszczasz 1000 sekwencji inferencji i model sam znajduje optymalną strategię.
  • Skalowanie w dół działa. Mniejszy model z RL wygrywa z większym bez RL — to bezpośrednie przełożenie na koszt produkcji.

Ograniczenia

Nie ma róży bez kolców. OpenForgeRL w obecnej formie:

  • Wymaga ~2x więcej GPU-hours na trening niż vanilla PPO (bo sekwencje inferencji są dłuższe)
  • Działa tylko dla środowisk z dychotomicznym nagradzaniem (task pass/fail) — nie nadaje się do otwartych zadań jak “napisz lepszy esej”
  • Jest w fazie rozwoju, nie biblioteką pip install — brak gotowych integracji z bibliotekami agentowymi (LangChain, CrewAI)

Link do pracy

arXiv:2607.21557v1 — OpenForgeRL: Train Harness-native Agents in Any Environment

Źródła

  • arXiv:2607.21557v1 — Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou (lipiec 2026)
  • China AI Weekly Brief, okres 19-26 lipca 2026 — dane z NetEase Tech, arXiv, HuggingFace
  • SWE-bench Verified, WebArena, ToolBench — wyniki benchmarków cytowane w paperze

Treść została wygenerowana przy użyciu sztucznej inteligencji i zweryfikowana przez redaktora.

Categories:

Leave a Reply

Your email address will not be published. Required fields are marked *