ZJU-REAL
ZJU-REAL

SDAR

Official code for "Self-Distilled Agentic Reinforcement Learning"

25fork
336watcher
8issue
Python

Analisi AI · Italiano

openai · gpt-4o-mini

Sintesi

SDAR (Self-Distilled Agentic Reinforcement Learning) è un metodo innovativo che migliora significativamente le prestazioni degli agenti di apprendimento per rinforzo attraverso l'auto-distillazione. Il progetto fornisce il codice ufficiale per l'implementazione di SDAR, dimostrando miglioramenti su benchmark complessi come ALFWorld, WebShop e Search-QA. SDAR si presenta come una soluzione avanzata per lo sviluppo di agenti intelligenti in ambienti complessi.

Casi d'uso

  • Miglioramento delle prestazioni di agenti AI in ambienti di gioco o simulazione complessi (es. ALFWorld) per risolvere puzzle e compiti sequenziali.
  • Sviluppo di agenti intelligenti per la navigazione e l'interazione automatizzata in ambienti web (es. WebShop) per compiti come acquisti online o estrazione di informazioni.
  • Creazione di sistemi di AI per la ricerca e la risposta a domande complesse (es. Search-QA) che richiedono comprensione del contesto e recupero di informazioni da vaste basi di conoscenza.

Idee SaaS / Business

Piattaforma di Formazione Agente AI Avanzata

Una piattaforma cloud-based che permette a sviluppatori e aziende di addestrare e implementare agenti AI basati su SDAR in ambienti simulati personalizzati, con strumenti per il debugging e l'ottimizzazione delle performance. Offri piani di abbonamento in base all'uso delle risorse e alla complessità degli ambienti.

Ottimizzatore di Agenti Web Intelligenti

Un servizio che utilizza la metodologia SDAR per ottimizzare agenti di navigazione web per e-commerce, automazione di task ripetitivi o scraping intelligente. I clienti possono definire gli obiettivi e SDAR addestrerà un agente per raggiungere le massime prestazioni, migliorando l'efficienza e riducendo gli errori.

Soluzione di AI per la Ricerca e il Q&A Intelligente

Un'API o un servizio white-label che integra le capacità di SDAR per creare sistemi di ricerca semantica e Q&A di nuova generazione. Ideale per aziende con grandi dataset interni (documentazione tecnica, database clienti) che necessitano risposte precise e contestualizzate in tempo reale.

Target utenti
Ricercatori AI, sviluppatori di apprendimento per rinforzo, aziende che sviluppano agenti intelligenti per automazione, gaming o assistenza virtuale, accademici nel campo dell'AI.
Categoria
Python, PyTorch, vLLM
Monetizzazione
Il modello di monetizzazione potrebbe basarsi su licenze software per uso commerciale della metodologia o su un modello SaaS per l'accesso a piattaforme di addestramento e deployment di agenti AI basati su SDAR, con costi basati sulle risorse computazionali utilizzate e sul volume di chiamate API.
Licenza
Apache License 2.0
Trend: L'apprendimento per rinforzo agentico e l'auto-distillazione sono al centro delle tendenze attuali nell'AI per lo sviluppo di agenti autonomi più efficienti e versatili.

README · tradotto in italiano

Apprendimento per Rinforzo Agente Auto-Distillato

Introduciamo SDAR, un metodo di apprendimento per rinforzo agente auto-distillato.

Motivazione e Metodo SDAR Motivazione e Metodo SDAR

SDAR ottiene miglioramenti sostanziali rispetto alla baseline RL standard su ALFWorld, WebShop e Search-QA.

Metriche di Performance

Notizie

  • 2026-5-15: Abbiamo pubblicato il nostro paper e il codice.

Installazione

Ambiente Python

conda create -n skillzero python==3.12 -y
conda activate skillzero

pip3 install vllm==0.11.0

pip3 install flash-attn==2.7.4.post1 --no-build-isolation --no-cache-dir
pip install -e .

Accedi a Weights & Biases se utilizzi il logging di WandB (gli script passano trainer.logger=['console','wandb'] in molti casi):

export WANDB_API_KEY=la_tua_chiave_API_qui

Installazione degli Ambienti Supportati

1. ALFWorld

Installa con pip:

pip3 install gymnasium==0.29.1
pip3 install stable-baselines3==2.6.0
pip3 install alfworld

Scarica i file PDDL & Game e il rilevatore pre-addestrato MaskRCNN (verranno archiviati in ~/.cache/alfworld/):

alfworld-download -f

2. WebShop

WebShop richiede Python <=3.10, quindi inizia creando un nuovo ambiente:

conda create -n verl-webshop python==3.10 -y
conda activate verl-webshop

Installa WebShop:

cd ./agent_system/environments/env_package/webshop/webshop
./setup.sh -d all

Dopo aver installato WebShop, torna alla directory radice e installa il pacchetto verl:

cd repo_root/
pip3 install torch==2.6.0 --index-url https://download.pytorch.org/whl/cu124
pip3 install flash-attn==2.7.4.post1 --no-build-isolation
pip3 install -e .
pip3 install vllm==0.8.2
# spacy 3.7.2 richiede typer<0.10.0,>=0.3.0, ma tu hai typer 0.15.2 che è incompatibile.
# weasel 0.3.4 richiede typer<0.10.0,>=0.3.0, ma tu hai typer 0.15.2 che è incompatibile.

Gli avvisi possono essere tranquillamente ignorati.

cd ./agent_system/environments/env_package/search/third_party
pip install -e .
pip install gym==0.26.2

Prepara il dataset (i dati verranno salvati in ~/data/searchR1_processed_direct):

cd repo_root/
python examples/data_preprocess/preprocess_search_r1_dataset.py

Poiché faiss-gpu non è disponibile tramite pip, configuriamo un ambiente conda separato per il server di recupero locale. L'esecuzione di questo server utilizzerà circa 6 GB di memoria GPU per GPU, quindi assicurati di tenerne conto nella configurazione della tua esecuzione di training. Costruisci gli ambienti Retriever:

# Crea e attiva l'ambiente retriever con Python 3.10
conda create -n retriever python=3.10 -y
conda activate retriever

# Installa PyTorch (con supporto GPU) e librerie correlate
conda install numpy==1.26.4 # necessario per impedire l'installazione di una versione incompatibile di numpy tramite pip
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124

# Installa altri pacchetti Python
pip install transformers datasets pyserini huggingface_hub

# Installa la versione GPU di faiss
conda install faiss-gpu==1.8.0 -c pytorch -c nvidia -y

# Installa il framework di servizio API
pip install uvicorn fastapi

Scarica l'indice:

conda activate retriever

local_dir=~/data/searchR1
python examples/search/searchr1_download.py --local_dir $local_dir
cat $local_dir/part_* > $local_dir/e5_Flat.index
gzip -d $local_dir/wiki-18.jsonl.gz

Avvia il server di recupero locale flat e5:

conda activate retriever

# reindirizza l'output a un file per evitare di ingombrare il terminale
# abbiamo osservato che l'outputting al terminale causava picchi nei tempi di risposta del server
bash examples/search/retriever/retrieval_launch.sh > retrieval_server.log 

Training

Tutti gli script si trovano sotto examples/ e assumono la directory radice del repository come directory di lavoro. Puoi eseguire, ad esempio:

bash examples/sdar_trainer/run_alfworld_3b.sh
bash examples/sdar_trainer/run_search_3b.sh
bash examples/sdar_trainer/run_webshop_3b.sh

Unione di checkpoint

Vedi scripts/model_merger.py per esempi di unione FSDP/Megatron utilizzando percorsi sotto ./checkpoints/....

Citazione

Se trovi utile questo progetto, benvenuto a citarci.

@misc{lu2026sdar,
      title={Self-Distilled Agentic Reinforcement Learning}, 
      author={Zhengxi Lu and Zhiyuan Yao and Zhuowen Han and Zi-Han Wang and Jinyang Wu and Qi Gu and Xunliang Cai and Weiming Lu and Jun Xiao and Yueting Zhuang and Yongliang Shen},
      year={2026},
      eprint={2605.15155},
      archivePrefix={arXiv},
      primaryClass={cs.LG},
      url={https://arxiv.org/abs/2605.15155}, 
}

Ringraziamenti

Questo progetto è basato su verl-agent, veRL, ALFWorld, SkillRL e Search-R1. Ringraziamo gli autori di questi progetti.

Attività commit · ultime 26 settimane

stima

Approfondimenti AI

L'AI sta preparando gli approfondimenti…

Chiedi al repo

AI · contesto README + issue

Fai una domanda sul progetto. L'AI legge README e issue recenti.

Sponsor · Sconto esclusivo RepoRadar AI

Hai bisogno di un server per far girare ZJU-REAL/SDAR?

Abbiamo testato decine di provider e Hostinger VPS è il miglior rapporto qualità/prezzo per self-hostare le repo che trovi qui. Setup in 1 click, pannello semplice e supporto 24/7.

Deploy in 1 click
2 vCPU · 8 GB RAM · NVMe
Backup + DDoS inclusi
Attiva sconto Hostinger VPSLink affiliato — supporti RepoRadar senza costi extra per te.

Questo progetto esiste grazie a voi

RepoRadar AI è gratis e senza pubblicità. Le donazioni coprono server, API e modelli AI.

Ogni analisi tradotta che leggi costa qualche centesimo di chiamate al modello. Se RepoRadar ti ha fatto risparmiare tempo, considera una piccola donazione cripto — anche pochi euro aiutano a mantenere il servizio libero per tutti.

Ethereum
ETH
0x86ECDF546d8dFc0739d44c066A6110F11cdB7773
Bitcoin
BTC
bc1qqe0wcmhnt78enk8ql0lxvey4z8hquxsxjtyz8r
Solana
SOL
EtTK61Lz7kfdDM8543TMMiAUUTbFVpzX5tvPEcBtZ3aj

Grazie di cuore — ogni contributo conta.