Analisi AI · Italiano
openai · gpt-4o-miniSintesi
SDAR (Self-Distilled Agentic Reinforcement Learning) è un metodo innovativo che migliora significativamente le prestazioni degli agenti di apprendimento per rinforzo attraverso l'auto-distillazione. Il progetto fornisce il codice ufficiale per l'implementazione di SDAR, dimostrando miglioramenti su benchmark complessi come ALFWorld, WebShop e Search-QA. SDAR si presenta come una soluzione avanzata per lo sviluppo di agenti intelligenti in ambienti complessi.
Casi d'uso
- →Miglioramento delle prestazioni di agenti AI in ambienti di gioco o simulazione complessi (es. ALFWorld) per risolvere puzzle e compiti sequenziali.
- →Sviluppo di agenti intelligenti per la navigazione e l'interazione automatizzata in ambienti web (es. WebShop) per compiti come acquisti online o estrazione di informazioni.
- →Creazione di sistemi di AI per la ricerca e la risposta a domande complesse (es. Search-QA) che richiedono comprensione del contesto e recupero di informazioni da vaste basi di conoscenza.
Idee SaaS / Business
Una piattaforma cloud-based che permette a sviluppatori e aziende di addestrare e implementare agenti AI basati su SDAR in ambienti simulati personalizzati, con strumenti per il debugging e l'ottimizzazione delle performance. Offri piani di abbonamento in base all'uso delle risorse e alla complessità degli ambienti.
Un servizio che utilizza la metodologia SDAR per ottimizzare agenti di navigazione web per e-commerce, automazione di task ripetitivi o scraping intelligente. I clienti possono definire gli obiettivi e SDAR addestrerà un agente per raggiungere le massime prestazioni, migliorando l'efficienza e riducendo gli errori.
Un'API o un servizio white-label che integra le capacità di SDAR per creare sistemi di ricerca semantica e Q&A di nuova generazione. Ideale per aziende con grandi dataset interni (documentazione tecnica, database clienti) che necessitano risposte precise e contestualizzate in tempo reale.
README · tradotto in italiano
Apprendimento per Rinforzo Agente Auto-Distillato
Introduciamo SDAR, un metodo di apprendimento per rinforzo agente auto-distillato.

SDAR ottiene miglioramenti sostanziali rispetto alla baseline RL standard su ALFWorld, WebShop e Search-QA.

Notizie
- 2026-5-15: Abbiamo pubblicato il nostro paper e il codice.
Installazione
Ambiente Python
conda create -n skillzero python==3.12 -y
conda activate skillzero
pip3 install vllm==0.11.0
pip3 install flash-attn==2.7.4.post1 --no-build-isolation --no-cache-dir
pip install -e .
Accedi a Weights & Biases se utilizzi il logging di WandB (gli script passano trainer.logger=['console','wandb'] in molti casi):
export WANDB_API_KEY=la_tua_chiave_API_qui
Installazione degli Ambienti Supportati
1. ALFWorld
Installa con pip:
pip3 install gymnasium==0.29.1
pip3 install stable-baselines3==2.6.0
pip3 install alfworld
Scarica i file PDDL & Game e il rilevatore pre-addestrato MaskRCNN (verranno archiviati in ~/.cache/alfworld/):
alfworld-download -f
2. WebShop
WebShop richiede Python <=3.10, quindi inizia creando un nuovo ambiente:
conda create -n verl-webshop python==3.10 -y
conda activate verl-webshop
Installa WebShop:
cd ./agent_system/environments/env_package/webshop/webshop
./setup.sh -d all
Dopo aver installato WebShop, torna alla directory radice e installa il pacchetto verl:
cd repo_root/
pip3 install torch==2.6.0 --index-url https://download.pytorch.org/whl/cu124
pip3 install flash-attn==2.7.4.post1 --no-build-isolation
pip3 install -e .
pip3 install vllm==0.8.2
# spacy 3.7.2 richiede typer<0.10.0,>=0.3.0, ma tu hai typer 0.15.2 che è incompatibile.
# weasel 0.3.4 richiede typer<0.10.0,>=0.3.0, ma tu hai typer 0.15.2 che è incompatibile.
Gli avvisi possono essere tranquillamente ignorati.
3. Search
cd ./agent_system/environments/env_package/search/third_party
pip install -e .
pip install gym==0.26.2
Prepara il dataset (i dati verranno salvati in ~/data/searchR1_processed_direct):
cd repo_root/
python examples/data_preprocess/preprocess_search_r1_dataset.py
Poiché faiss-gpu non è disponibile tramite pip, configuriamo un ambiente conda separato per il server di recupero locale. L'esecuzione di questo server utilizzerà circa 6 GB di memoria GPU per GPU, quindi assicurati di tenerne conto nella configurazione della tua esecuzione di training. Costruisci gli ambienti Retriever:
# Crea e attiva l'ambiente retriever con Python 3.10
conda create -n retriever python=3.10 -y
conda activate retriever
# Installa PyTorch (con supporto GPU) e librerie correlate
conda install numpy==1.26.4 # necessario per impedire l'installazione di una versione incompatibile di numpy tramite pip
pip install torch==2.6.0 torchvision==0.21.0 torchaudio==2.6.0 --index-url https://download.pytorch.org/whl/cu124
# Installa altri pacchetti Python
pip install transformers datasets pyserini huggingface_hub
# Installa la versione GPU di faiss
conda install faiss-gpu==1.8.0 -c pytorch -c nvidia -y
# Installa il framework di servizio API
pip install uvicorn fastapi
Scarica l'indice:
conda activate retriever
local_dir=~/data/searchR1
python examples/search/searchr1_download.py --local_dir $local_dir
cat $local_dir/part_* > $local_dir/e5_Flat.index
gzip -d $local_dir/wiki-18.jsonl.gz
Avvia il server di recupero locale flat e5:
conda activate retriever
# reindirizza l'output a un file per evitare di ingombrare il terminale
# abbiamo osservato che l'outputting al terminale causava picchi nei tempi di risposta del server
bash examples/search/retriever/retrieval_launch.sh > retrieval_server.log
Training
Tutti gli script si trovano sotto examples/ e assumono la directory radice del repository come directory di lavoro. Puoi eseguire, ad esempio:
bash examples/sdar_trainer/run_alfworld_3b.sh
bash examples/sdar_trainer/run_search_3b.sh
bash examples/sdar_trainer/run_webshop_3b.sh
Unione di checkpoint
Vedi scripts/model_merger.py per esempi di unione FSDP/Megatron utilizzando percorsi sotto ./checkpoints/....
Citazione
Se trovi utile questo progetto, benvenuto a citarci.
@misc{lu2026sdar,
title={Self-Distilled Agentic Reinforcement Learning},
author={Zhengxi Lu and Zhiyuan Yao and Zhuowen Han and Zi-Han Wang and Jinyang Wu and Qi Gu and Xunliang Cai and Weiming Lu and Jun Xiao and Yueting Zhuang and Yongliang Shen},
year={2026},
eprint={2605.15155},
archivePrefix={arXiv},
primaryClass={cs.LG},
url={https://arxiv.org/abs/2605.15155},
}
Ringraziamenti
Questo progetto è basato su verl-agent, veRL, ALFWorld, SkillRL e Search-R1. Ringraziamo gli autori di questi progetti.
Attività commit · ultime 26 settimane
stimaApprofondimenti AI
Chiedi al repo
AI · contesto README + issueFai una domanda sul progetto. L'AI legge README e issue recenti.
Hai bisogno di un server per far girare ZJU-REAL/SDAR?
Abbiamo testato decine di provider e Hostinger VPS è il miglior rapporto qualità/prezzo per self-hostare le repo che trovi qui. Setup in 1 click, pannello semplice e supporto 24/7.
Questo progetto esiste grazie a voi
RepoRadar AI è gratis e senza pubblicità. Le donazioni coprono server, API e modelli AI.
Ogni analisi tradotta che leggi costa qualche centesimo di chiamate al modello. Se RepoRadar ti ha fatto risparmiare tempo, considera una piccola donazione cripto — anche pochi euro aiutano a mantenere il servizio libero per tutti.
0x86ECDF546d8dFc0739d44c066A6110F11cdB7773bc1qqe0wcmhnt78enk8ql0lxvey4z8hquxsxjtyz8rEtTK61Lz7kfdDM8543TMMiAUUTbFVpzX5tvPEcBtZ3ajGrazie di cuore — ogni contributo conta.