RecursiveMAS: agenti AI che comunicano senza parole — -75% costi, open source

Stanford, NVIDIA e MIT presentano RecursiveMAS: agenti AI che comunicano via vettori latenti invece di testo, con -75% di costi token e +8% di performance. Open source, costo training $4.27.

BlueSky Agent AI ·

RecursiveMAS: agenti AI che comunicano senza parole — -75% costi, open source

Come comunicano gli agenti AI tra loro — e perché è inefficiente

Nei sistemi multi-agente attuali, gli agenti AI comunicano come gli umani: si scrivono messaggi in linguaggio naturale. L'Agente A genera un testo, l'Agente B lo riceve, lo elabora e risponde con un altro testo.

Il problema è che questo processo è enormemente costoso. Ogni testo generato consuma token. Più agenti comunicano, più token servono. Un sistema con 5 agenti che si passano informazioni complesse può consumare migliaia di token in scambi intermedi — pagando il fornitore LLM per ogni parola.

Un team di ricercatori di Stanford, NVIDIA e MIT ha trovato una soluzione radicale: eliminare il linguaggio naturale dagli scambi inter-agente e usare vettori latenti — l'equivalente della "telepatia" tra agenti AI.

RecursiveMAS: comunicazione latente tra agenti

RecursiveMAS (Recursive Multi-Agent System) è il framework presentato in un paper pubblicato su arXiv da Stanford/NVIDIA/MIT nel maggio 2026. Il principio fondamentale: invece di convertire le rappresentazioni interne degli agenti in testo (token) per comunicare, gli agenti si passano direttamente i vettori latenti — le rappresentazioni numeriche interne che il modello usa per "pensare".

È la differenza tra due persone che si spiegano un concetto a parole e due persone che si trasferiscono direttamente la comprensione. Nessuna traduzione, nessuna perdita di informazione, nessun costo di tokenizzazione.

Il modulo chiave che abilita questo è Sim Link (Similarity Linkage), un componente aggiuntivo che costa in training solo $4.27 — meno di un caffè.

I risultati: -75% token, +8% performance

I benchmark pubblicati mostrano risultati significativi rispetto ai sistemi multi-agente tradizionali basati su comunicazione testuale:

  • -75% di token usage negli scambi tra agenti: ogni coordinamento usa meno di un quarto dei token rispetto all'approccio testuale.
  • +8% di performance sui benchmark standard: la comunicazione latente preserva sfumature e contesto che si perdono nella traduzione in linguaggio naturale.
  • Costo del modulo Sim Link: $4.27 per addestrare l'agente a usare vettori latenti invece di token.
  • Il codice è open-source: disponibile su GitHub e HuggingFace.

Perché conta per le PMI italiane

Questo non è solo un paper accademico. Le implicazioni pratiche per le aziende che usano sistemi multi-agente sono concrete:

Costo operativo: i sistemi multi-agente enterprise, specialmente quelli usati per workflow complessi (analisi legale, ricerca e sviluppo, customer service sofisticato), possono costare centinaia di euro al mese in API LLM. Ridurre del 75% la comunicazione inter-agente riduce direttamente il costo operativo.

Latenza: generare e tokenizzare testo richiede tempo. Con la comunicazione latente, gli scambi tra agenti sono più veloci — il che si traduce in workflow più rapidi per gli utenti finali.

Qualità: la comunicazione testuale può perdere sfumature nel processo di "traduzione" del pensiero in parole. I vettori latenti preservano la rappresentazione interna originale, con un +8% di performance sui task di ragionamento complesso.

Stato attuale e roadmap per l'adozione

RecursiveMAS è attualmente un framework di ricerca open-source, non un prodotto enterprise. Le considerazioni pratiche per le aziende che vogliono esplorarlo:

  • Compatibilità: funziona con modelli che supportano accesso ai vettori latenti interni — al momento principalmente modelli open-source o modelli Anthropic con API avanzate.
  • Integrazione: richiede una fase di fine-tuning (Sim Link training, $4.27) per ogni coppia di agenti che comunicano. Fattibile per workflow fissi, più complesso per workflow dinamici.
  • Maturità: ancora in fase di ricerca. L'orizzonte temporale realistico per deployment enterprise: 12-18 mesi, man mano che i provider LLM adottano le API necessarie e il framework matura.

Il segnale più importante: la direzione dell'efficienza

Al di là della tecnica, RecursiveMAS conferma una tendenza strutturale: i sistemi multi-agente stanno diventando più efficienti a ritmo accelerato. Ogni trimestre emergono framework che riducono drasticamente i costi operativi dell'AI agentica.

Per le PMI, questo significa che il lock-in tecnologico è un rischio reale — scegliere piattaforme che supportano multi-modello e sono agnostiche rispetto all'architettura sottostante è fondamentale.

Su BlueSky Agent AI, ModelMatch gestisce automaticamente il routing tra modelli: quando framework come RecursiveMAS diventeranno disponibili nei provider LLM mainstream, le PMI che usano la piattaforma ne beneficeranno automaticamente, senza dover riscrivere i propri agenti.

Conclusione: la telepatia AI è già realtà in laboratorio

RecursiveMAS di Stanford/NVIDIA/MIT mostra che il costo e la qualità dei sistemi multi-agente sono ancora ottimizzabili in modo significativo. Il -75% di token usage e il +8% di performance non sono margini piccoli.

Per le PMI italiane che stanno valutando o hanno già implementato sistemi multi-agente: questo tipo di innovazione si tradurrà in costi più bassi e qualità più alta nei prossimi 12-18 mesi. L'AI agentica enterprise diventa sempre più accessibile. La domanda è chi inizia prima a costruire la competenza interna per usarla.

RecursiveMAS: agenti AI che comunicano senza parole — -75% costi, open source — BlueSky Agent AI