RecursiveMAS: agenti AI che comunicano senza parole — -75% costi, open source
Stanford, NVIDIA e MIT presentano RecursiveMAS: agenti AI che comunicano via vettori latenti invece di testo, con -75% di costi token e +8% di performance. Open source, costo training $4.27.
BlueSky Agent AI ·
Come comunicano gli agenti AI tra loro — e perché è inefficiente
Nei sistemi multi-agente attuali, gli agenti AI comunicano come gli umani: si scrivono messaggi in linguaggio naturale. L'Agente A genera un testo, l'Agente B lo riceve, lo elabora e risponde con un altro testo.
Il problema è che questo processo è enormemente costoso. Ogni testo generato consuma token. Più agenti comunicano, più token servono. Un sistema con 5 agenti che si passano informazioni complesse può consumare migliaia di token in scambi intermedi — pagando il fornitore LLM per ogni parola.
Un team di ricercatori di Stanford, NVIDIA e MIT ha trovato una soluzione radicale: eliminare il linguaggio naturale dagli scambi inter-agente e usare vettori latenti — l'equivalente della "telepatia" tra agenti AI.
RecursiveMAS: comunicazione latente tra agenti
RecursiveMAS (Recursive Multi-Agent System) è il framework presentato in un paper pubblicato su arXiv da Stanford/NVIDIA/MIT nel maggio 2026. Il principio fondamentale: invece di convertire le rappresentazioni interne degli agenti in testo (token) per comunicare, gli agenti si passano direttamente i vettori latenti — le rappresentazioni numeriche interne che il modello usa per "pensare".
È la differenza tra due persone che si spiegano un concetto a parole e due persone che si trasferiscono direttamente la comprensione. Nessuna traduzione, nessuna perdita di informazione, nessun costo di tokenizzazione.
Il modulo chiave che abilita questo è Sim Link (Similarity Linkage), un componente aggiuntivo che costa in training solo $4.27 — meno di un caffè.
I risultati: -75% token, +8% performance
I benchmark pubblicati mostrano risultati significativi rispetto ai sistemi multi-agente tradizionali basati su comunicazione testuale:
- -75% di token usage negli scambi tra agenti: ogni coordinamento usa meno di un quarto dei token rispetto all'approccio testuale.
- +8% di performance sui benchmark standard: la comunicazione latente preserva sfumature e contesto che si perdono nella traduzione in linguaggio naturale.
- Costo del modulo Sim Link: $4.27 per addestrare l'agente a usare vettori latenti invece di token.
- Il codice è open-source: disponibile su GitHub e HuggingFace.
Perché conta per le PMI italiane
Questo non è solo un paper accademico. Le implicazioni pratiche per le aziende che usano sistemi multi-agente sono concrete:
Costo operativo: i sistemi multi-agente enterprise, specialmente quelli usati per workflow complessi (analisi legale, ricerca e sviluppo, customer service sofisticato), possono costare centinaia di euro al mese in API LLM. Ridurre del 75% la comunicazione inter-agente riduce direttamente il costo operativo.
Latenza: generare e tokenizzare testo richiede tempo. Con la comunicazione latente, gli scambi tra agenti sono più veloci — il che si traduce in workflow più rapidi per gli utenti finali.
Qualità: la comunicazione testuale può perdere sfumature nel processo di "traduzione" del pensiero in parole. I vettori latenti preservano la rappresentazione interna originale, con un +8% di performance sui task di ragionamento complesso.
Stato attuale e roadmap per l'adozione
RecursiveMAS è attualmente un framework di ricerca open-source, non un prodotto enterprise. Le considerazioni pratiche per le aziende che vogliono esplorarlo:
- Compatibilità: funziona con modelli che supportano accesso ai vettori latenti interni — al momento principalmente modelli open-source o modelli Anthropic con API avanzate.
- Integrazione: richiede una fase di fine-tuning (Sim Link training, $4.27) per ogni coppia di agenti che comunicano. Fattibile per workflow fissi, più complesso per workflow dinamici.
- Maturità: ancora in fase di ricerca. L'orizzonte temporale realistico per deployment enterprise: 12-18 mesi, man mano che i provider LLM adottano le API necessarie e il framework matura.
Il segnale più importante: la direzione dell'efficienza
Al di là della tecnica, RecursiveMAS conferma una tendenza strutturale: i sistemi multi-agente stanno diventando più efficienti a ritmo accelerato. Ogni trimestre emergono framework che riducono drasticamente i costi operativi dell'AI agentica.
Per le PMI, questo significa che il lock-in tecnologico è un rischio reale — scegliere piattaforme che supportano multi-modello e sono agnostiche rispetto all'architettura sottostante è fondamentale.
Su BlueSky Agent AI, ModelMatch gestisce automaticamente il routing tra modelli: quando framework come RecursiveMAS diventeranno disponibili nei provider LLM mainstream, le PMI che usano la piattaforma ne beneficeranno automaticamente, senza dover riscrivere i propri agenti.
Conclusione: la telepatia AI è già realtà in laboratorio
RecursiveMAS di Stanford/NVIDIA/MIT mostra che il costo e la qualità dei sistemi multi-agente sono ancora ottimizzabili in modo significativo. Il -75% di token usage e il +8% di performance non sono margini piccoli.
Per le PMI italiane che stanno valutando o hanno già implementato sistemi multi-agente: questo tipo di innovazione si tradurrà in costi più bassi e qualità più alta nei prossimi 12-18 mesi. L'AI agentica enterprise diventa sempre più accessibile. La domanda è chi inizia prima a costruire la competenza interna per usarla.