Scopri i vincitori degli Italian Project Awards 2025
La vera sfida dell’AI enterprise non è più adottare i modelli, ma renderli sostenibili, governabili e sicuri nel tempo, trasformando la sperimentazione in valore misurabile per il business
Fonte: immagine fornita da agenzia
Ormai è assodato che la parte più difficile dell’AI enterprise non sono più i pilot, ma tutto ciò che viene dopo. L’iniziativa Nanda del MIT ha rilevato che, nonostante una spesa di 30-40 miliardi di dollari, il 95% dei programmi di AI generativa in ambito aziendale non ha prodotto alcun impatto misurabile sul conto economico, e che - nel 2025 - il 42% delle imprese ha abbandonato la maggior parte delle proprie iniziative AI segnando un significativo aumento dal 17% dell’anno precedente. Il messaggio è chiaro: l’accesso ai modelli più avanzati è ormai una commodity, e il vantaggio duraturo appartiene a chi è in grado di sostenere, governare e difendere l’AI una volta uscita dalla fase di demo.
Con l'Apply AI Strategy, la Commissione Europea ha lanciato l'Apply AI Alliance: un programma da un miliardo di euro che riunisce industria, settore pubblico e accademia per accelerare il deployment dell'AI in undici settori strategici, dalla sanità alla manifattura, dall'energia alla difesa. Un chiaro segnale di come agli enti regolatori ora non importa più se le imprese che collaborano con loro usano l’AI, ma come la usano e se sono in grado di dimostrare come si comporta. Ed è in questo cambio di prospettiva che si è spostata tutta la sfida.
Il pricing a token inganna. Con la proliferazione degli agenti, Goldman Sachs prevede un aumento di 24 volte nel consumo di token entro il 2030. Più agenti utilizzate, più i costi si moltiplicano, e i conti non tornano. Chi gestisce l'AI in produzione con rigore smette di contare i token. Misura invece quattro cose: quanto costa ogni operazione, quanto controllo ha sul sistema, quali performance ottiene e quanto pesa gestirlo nel tempo. Il tutto si riduce a una sola metrica: il costo per attività utile completata. Se non si riesce a misurare quanto costa portare a termine un’attività concreta, non è possibile giustificare il budget che la finanzia.
La stessa metrica dovrebbe guidare la scelta di dove eseguire i carichi di lavoro. Il cloud pubblico vince in termini di velocità, sperimentazione e accesso ai modelli più avanzati; l’inferenza privata e sovrana si impone su quelli ad alto volume, regolamentati o sensibili alla latenza. La scelta del contesto di esecuzione non è marginale: il MIT ha rilevato che i progetti AI sviluppati con vendor specializzati e in partnership hanno un tasso di successo del 67%, contro circa il 33% d quelli costruiti interamente in-house. La scelta di dove e come eseguire i workload AI è oggi la linea di confine tra un progetto redditizio e uno che genera solo costi.
In pratica, il punto di partenza è sempre l’attività di business, non il modello. Una volta definita l’attività, si sceglie il modello più semplice in grado di eseguirla in modo affidabile. Si misura il costo per attività completata, non per token. E si decide dove far girare il lavoro: cloud pubblico per velocità e sperimentazione, ambienti privati o sovrani quando contano costi, controllo e latenza. Sostenere l’AI in produzione significa una cosa sola: i numeri devono reggere anche dopo la fine della demo. Oggi, il 95% dei programmi non riesce a dimostrarlo.

Il controllo viene meno quando un dirigente non riesce a rispondere a quattro domande semplici: perché il sistema ha agito in quel modo? Quali regole ha applicato? Quali dati ha usato? Chi è responsabile dell’esito? E qui non si tratta di un problema tecnico, ma strutturale. Il Data Readiness Index di Cloudera lo conferma: solo il 26% delle aziende nell’area EMEA dispone di dati completamente governati. Non si può controllare la decisione di un agente se i dati su cui si basa non sono stati governati prima. La catena di controllo è corrotta a monte, non a livello del singolo agente.
Il rischio si moltiplica man mano che gli agenti passano dal rispondere a domande all’agire su strumenti e flussi di lavoro. Gartner prevede che l’AI agentica guiderà almeno il 15% delle decisioni operative quotidiane entro il 2028, rispetto a un valore prossimo allo zero nel 2024, e sarà integrata in un terzo dei software aziendali. L’entropia operativa, ovvero pilot che si moltiplicano tra i team senza standard condivisi, policy o visibilità, è esattamente il modo in cui quell’autonomia diventa frammentata, costosa e inaffidabile. La scala senza standard non aggiunge capacità: moltiplica solo la superficie di rischio.
Per governare efficacemente servono tre cose. Prima: definire con precisione cosa ogni modello o agente è autorizzato a fare. Seconda: applicare policy comuni a tutti i team. Terza: creare audit trail e un’orchestrazione che assegni i carichi di lavoro in base a costi, latenza, valore, sensibilità e necessità di governance, con punti di controllo umano espliciti sulle azioni ad alto rischio. Le conseguenze di non farlo sono concrete. Gartner prevede che oltre il 40% dei progetti di AI agentica verrà annullato entro il 2027 principalmente per scarsi controlli del rischio e impossibilità di dimostrarne il valore. L’obiettivo non è bloccare l’autonomia, ma calibrarla. Perché i progetti che moriranno nel 2027 non lo faranno per mancanza di modelli, ma per assenza di governance.

Difendere l’AI significa progettare per il momento in cui sbaglia, è ambigua o opera in un contesto ad alto rischio. Un framework efficace comprende tre aspetti: valutare i rischi prima del deployment, limitare l’autonomia degli agenti e il loro accesso a strumenti e dati, definire i punti di controllo in cui l’approvazione umana è obbligatoria. La maturità non si misura più da quanto si automatizza, ma da quanto consapevolmente si decide cosa non automatizzare.
Un modello pratico di difesa prevede quattro elementi: diritti decisionali chiaramente definiti, autonomia graduata, tracciabilità completa di input, azioni e output, e interruttori di emergenza con possibilità di override delle policy. Ma attenzione: la revisione deve essere selettiva. Verificare tutto distrugge il ROI, ed è esattamente questa la trappola che porta al fallimento di quel 40% e oltre di progetti indicato da Gartner. Un approccio maturo automatizza il lavoro a basso rischio e indirizza verso gli esseri umani solo i casi ambigui, ad alto impatto o eccezionali. La supervisione umana dovrebbe essere un bisturi, non una coperta.
In pratica, occorre quindi definire cosa un agente può raccomandare ed eseguire direttamente; subordinare le azioni ad alto rischio all’approvazione umana; usare soglie di confidenza e gestione delle eccezioni per filtrare i casi critici. E misurare le cose che contano davvero - tasso di errore, tasso di escalation, conformità, fiducia, onere di rilavorazione - con la stessa serietà con cui si valuta l’efficienza. Il 5% dei programmi che il MIT ha identificato come capaci di generare valore reale lo ha fatto integrando l’AI nei flussi di lavoro, senza inseguire il throughput grezzo. Difendere l’AI non significa rallentarla: vuol dire costruire il ciclo di controllo che moltiplica le performance contenendo il rischio.

Le regole dell’AI enterprise si stanno riscrivendo perché il collo di bottiglia non è più l’accesso ai modelli, ma la capacità di farli funzionare nel tempo. Per sostenere l’AI è necessario misurare il lavoro utile e collocare i carichi di lavoro dove rendono davvero. Per governarla, servono standard comuni, controlli di policy, tracciabilità, orchestrazione. Per difenderla, serve supervisione selettiva, salvaguardie rigide, sistemi progettati per gestire il fallimento con la stessa cura riservata al successo.
Il livello dei modelli si sta commoditizzando. La capacità frontier è ormai un dato di fatto, non un vantaggio competitivo. Ciò che costruisce vantaggio è altro: l’infrastruttura, la governance, la fiducia. Il 95% che si è arenato ha trattato l’AI come qualcosa da acquisire. Il 5% che ha avuto successo come qualcosa da operare. Questo divario è l’intera distanza tra un pilot e la produzione. E, sempre più, tra le aziende che guideranno il prossimo decennio e quelle che dovranno spiegare ai propri consigli di amministrazione perché la demo non si è mai ripagata.
La fiducia, non i token, è ora l’unità di misura. Costruite per essa.
Abhas Ricky (nella foto di apertura) è Chief Business Officer e General Manager of Applied AI di Cloudera
Se questo articolo ti è piaciuto e vuoi rimanere sempre informato