Chi ha impostato un budget per l’intelligenza artificiale guardando solo il prezzo per token sta per scoprire che quella era la parte più semplice della stima. Il costo dell’AI agentica si compone di voci che raramente finiscono in un preventivo iniziale, e capire come sono distribuite decide chi in azienda può davvero controllarle e con quali leve.
Costo dell’AI agentica: le voci che restano fuori dal prezzo per token
La fattura di un sistema agentico non si riduce al prezzo dell’API del modello. AWS mostra, nella propria pagina di pricing di AgentCore, che attorno al modello si aggiungono voci di costo separate: chiamate gateway, memoria a breve termine, storage della memoria a lungo termine, recupero dei ricordi e osservabilità [1]. Sono componenti infrastrutturali che esistono indipendentemente da quanti token il modello elabora, e che diventano visibili solo quando il sistema passa dal prototipo alla produzione.
Il problema si amplifica quando gli agenti non lavorano da soli. Nelle orchestrazioni multiagente ogni agente utilizza token per istruzioni, contesto, ragionamento e interazioni con gli strumenti, e le orchestrazioni moltiplicano le chiamate al modello facendo lievitare il costo complessivo rispetto a un singolo agente [2]. A questo si aggiunge un effetto meno intuitivo: le finestre di contesto possono crescere rapidamente perché ogni agente aggiunge il proprio ragionamento, i risultati degli strumenti e output intermedi, il che richiede tecniche di compattazione come il riepilogo o l’eliminazione selettiva per contenere i costi e restare entro i limiti del modello [2].
Un dato tratto dai programmi di intelligenza artificiale governativi aiuta a dimensionare il fenomeno, pur riguardando un contesto diverso da quello aziendale puro: modelli e piattaforme AI, cioè lo strato più visibile e quello che i team di procurement stimano con più sicurezza perché somiglia al licensing software tradizionale, rappresentano solo il 15%-20% del costo complessivo in qualsiasi programma che superi la fase pilota [3]. Il resto del budget si nasconde altrove, ed è proprio quell’altrove — gateway, memoria, orchestrazione, osservabilità — che può rappresentare una quota significativa della spesa reale.
Chi vede cosa: il monitoraggio come primo strumento di governo
Prima ancora di poter tagliare una spesa, occorre vederla scomposta. Il monitoraggio dei costi per agenti AI traccia il consumo di token per chiamata, per sessione, per agente e per modello, e correla i costi infrastrutturali di computazione, storage e networking con i dati di sessione; un gateway AI unificato può consolidare la fatturazione tra più fornitori di LLM in un’unica superficie di costo [4]. Questa granularità è ciò che trasforma una fattura cloud indistinta in una mappa leggibile: senza di essa, un aumento della spesa resta un numero senza una causa scatenante.
È qui che la disciplina FinOps entra in gioco come infrastruttura organizzativa, non solo tecnica. La FinOps Foundation sottolinea che in ambienti decentralizzati, senza standard condivisi, diventa molto più difficile attribuire i costi e leggere i pattern reali di utilizzo dell’AI; per questo raccomanda che le interazioni AI transitino attraverso interfacce comuni, SDK interni o piattaforme che applichino tagging, contesto e attribuzione del consumo ai diversi casi d’uso [5]. Senza quello strato comune, ogni team finisce per costruire il proprio modo di misurare, e i numeri smettono di essere comparabili.
Le pratiche FinOps per governare la spesa in intelligenza artificiale
Il segnale più netto arriva dai numeri di adozione. Secondo il report State of FinOps 2026, il 98% dei rispondenti dichiara di gestire ormai la spesa AI, e la gestione dei costi dell’intelligenza artificiale emerge come la competenza prioritaria da sviluppare: un indizio che il mercato tratta l’AI sempre meno come eccezione sperimentale e sempre più come categoria ordinaria di spesa da governare [5]. Lo stesso rapporto, ripreso dalla FinOps Foundation, mostra che il 78% delle pratiche FinOps risultava integrato nelle organizzazioni dei CTO o dei CIO, un dato che indica dove si stanno spostando davvero le decisioni di ottimizzazione: più vicino ai team di ingegneria che ai gruppi finanziari indipendenti [6].
Per misurare l’efficienza di un sistema agentico, la disciplina propone metriche pensate apposta per superare il limite del prezzo per token. L’Agent Cost Per Completed Task (ACCT) misura il costo totale necessario affinché un sistema AI completi con successo un’operazione end-to-end, indipendentemente dal modello di pricing sottostante, mentre l’Agent Value Multiple (AVM) esprime il rapporto tra il valore finanziario prodotto e il costo totale sostenuto per l’esecuzione degli agenti [7]. Sono strumenti concettuali più che tecnici, ma spostano la domanda da “quanto costa un token” a “quanto costa un risultato”.
Che il problema sia reale e non solo teorico lo conferma un sondaggio di Harness a 700 leader, secondo cui le organizzazioni intervistate stimano che il 26% della propria spesa AI venga sprecata, mentre più della metà degli intervistati dichiara che la propria organizzazione manca di un responsabile dedicato ai costi AI, con la responsabilità diffusa tra i team di ingegneria, piattaforma e FinOps [8]. Le organizzazioni con maggiore disciplina nel controllo dei costi condividono alcune pratiche ricorrenti:
- assegnare precocemente la responsabilità dei costi a una figura o a un team identificabile;
- centralizzare la visibilità della spesa invece di lasciarla frammentata tra progetti;
- integrare i dati di spesa direttamente nei flussi di lavoro, non solo nei report finanziari mensili.
Sono le strategie che, secondo i dati di Harness, distinguono chi tiene sotto controllo la spesa AI da chi la scopre solo in fattura [8].
Attribuire il costo dell’AI agentica a progetti e team: gli strumenti
Sapere chi ha generato quale costo è la condizione perché quel costo diventi governabile, e il mercato dei prodotti FinOps si sta muovendo in questa direzione. Harness ha rilasciato nel maggio 2026 AI Cost Management come funzionalità integrata nella propria piattaforma Cloud and AI Cost Management, che consente ai team FinOps di attribuire la spesa per l’intelligenza artificiale a livello di modello, token e agente, insieme ai dati esistenti sui costi del cloud [6]. È un passaggio significativo perché unisce due voci di spesa che spesso restano separate: quella del cloud tradizionale e quella specifica dell’AI.
Sul fronte della governance dell’infrastruttura, IBM Apptio ha presentato nuove soluzioni basate su Cloudability e Kubecost, con Cloudability Governance progettata per monitorare la conformità ai costi e applicare policy finanziarie direttamente nei flussi di lavoro, integrandosi con HashiCorp Cloud Platform e Terraform [9]. La logica è la stessa che guida la raccomandazione della FinOps Foundation sul tagging: se l’infrastruttura si espande rapidamente tramite Infrastructure as Code, la visibilità sui costi si mantiene solo se le policy finanziarie sono incorporate nello stesso flusso che genera l’infrastruttura, non aggiunte dopo.
Perché conta
Il costo dell’AI agentica smette di essere una linea di bilancio approssimativa solo quando qualcuno in azienda può scomporlo per agente, per progetto, per team e per attività completata. Le voci che restano fuori dal prezzo per token — gateway, memoria, orchestrazione, storage — non sono dettagli tecnici marginali: chi non le vede non le può governare. Le pratiche FinOps e gli strumenti di attribuzione descritti non eliminano la complessità di un sistema multiagente, ma la rendono leggibile a chi deve decidere dove investire e dove tagliare.
Fonti
- La vera sfida dell’IA in azienda non è più il modello, ma il suo utilizzo — ActuIA actuia.com | 24/06/2026
- Modelli di orchestrazione dell’agente di intelligenza artificiale – Azure Architecture Center — Microsoft Learn – Azure Architecture Center learn.microsoft.com | 12/05/2026
- Rethinking the cost and budget structure of government AI – Consultancy — Consultancy-me.com | 28/07/2026
- AI Agent Observability: Monitoring Autonomous Systems in Production — Agentuity agentuity.com
- Token governance: come governare costi, uso e valore dell’AI — AI4Business ai4business.it
- Rapporto su dimensioni, quote di mercato e tendenze di crescita al 2031 del software per l’efficienza dei carichi di lavoro nel cloud e la pianificazione a basso impatto ambientale. — Mordor Intelligence mordorintelligence.it
- FinOps per AI: come controllare i costi di LLM e inferenza — ZeroUno zerounoweb.it
- 1 in 4 dollars spent on AI goes to waste, report finds — HR Dive hrdive.com | 30/07/2026
- IBM Apptio introduce nuove soluzioni FinOps per la gestione dei costi cloud nell’era dell’AI — 01net.it
Questo articolo è prodotto dalla redazione agentica di One More Tech Away: contenuti generati con agenti AI e verificati con supervisione umana.

