Cosa succede al pensiero critico quando l'analisi che dovresti giudicare ti arriva già scritta, già completa e già persuasiva.
Ciao e buon lunedì!
A 758 consulenti del Boston Consulting Group è stato chiesto di risolvere un problema di business: individuare, in un'impresa con tre marchi, quale stesse andando meglio, e raccomandare cosa farne. I dati erano contenuti in due file diversi: un foglio di calcolo con le performance commerciali e le note di alcune interviste ai dirigenti. Il foglio, da solo, sembrava già raccontare l’intera storia, ma non era realmente così: le informazioni che ribaltavano la conclusione stavano nelle interviste, e chi si fermava ai numeri arrivava ad una risposta perfettamente coerente seppur sbagliata.
Un terzo dei consulenti ha lavorato senza assistenza. Gli altri due terzi avevano GPT-4 a disposizione, e uno dei due gruppi aveva ricevuto anche una formazione specifica all'uso di questo modello di intelligenza artificiale.
Il gruppo senza AI ha risposto correttamente nell'84,5% dei casi, quello con AI e formazione nel 60%.
Il fatto
L'esperimento è stato condotto da un gruppo di ricercatori di Harvard Business School, del MIT, della Wharton School e della stessa BCG, ed è stato pubblicato su Organization Science nel marzo 2026 con il titolo "Navigating the Jagged Technological Frontier". I 758 consulenti coinvolti rappresentavano circa il 7% di tutti i consulenti individuali dell'azienda a livello mondiale: non uno studente in laboratorio, ma professionisti pagati per analizzare, nel loro mestiere quotidiano. (Fonte: Dell'Acqua, McFowland, Mollick et al., "Navigating the Jagged Technological Frontier", Organization Science, vol. 37 n. 2, marzo 2026)
La prima metà dei risultati è quella che tutti hanno citato, ed è genuinamente positiva. Su diciotto compiti che rientravano in quello che i ricercatori chiamano la frontiera delle capacità del modello (generare idee di prodotto, scrivere un piano di lancio, costruire una segmentazione), i consulenti con AI hanno completato il 12% di compiti in più, li hanno completati il 25% più in fretta e con una qualità valutata superiore di circa trenta punti percentuali rispetto al gruppo di controllo. I guadagni maggiori andavano ai consulenti che partivano dai punteggi più bassi: lo strumento riduceva la distanza tra i meno bravi e i più bravi.
La seconda metà riguarda l'unico compito costruito fuori da quella frontiera, ossia il caso descritto qui sopra, dove la risposta corretta richiedeva di incrociare fonti che il modello non era in grado di incrociare da solo.
Lì i numeri si invertono: 84,5% di risposte corrette senza AI, 70,6% con AI, 60% con AI e formazione. In media, diciannove punti percentuali di accuratezza in meno.
Ci sono anche altri tre dettagli che penso siano ancora più interessanti.
Il primo è il tempo. I consulenti che sbagliavano avevano sicuramente impiegato meno sforzo per raggiungere il risultato: il gruppo che aveva ricevuto formazione sull’uso dell’AI ha impiegato circa il 30% di tempo in meno del gruppo di controllo; l'altro, invece, il 18% in meno.
Il secondo è la qualità percepita. Valutatori che non conoscevano la soluzione corretta hanno giudicato la coerenza e la solidità argomentativa delle risposte: il gruppo che aveva ricevuto formazione sull’uso dell’AI ha ottenuto il 25% in più del gruppo di controllo, l'altro il 18% in più. Il punto è che questo miglioramento valeva sia per chi aveva risposto bene sia per chi aveva sbagliato. Le raccomandazioni errate erano meglio scritte, meglio strutturate e più convincenti delle raccomandazioni errate prodotte senza assistenza.
Il terzo è il più sgradevole: ad avere la performance peggiore è stato il gruppo che aveva ricevuto la formazione. La differenza tra i due gruppi trattati è statisticamente debole (significativa solo al 10%, e gli autori non ci costruiscono sopra alcuna tesi), sicché la prendo per quello che è, cioè un indizio e non una prova. Ciononostante penso che questo fattore ci dica qualcosa di interessante: la formazione riguardava il modo di interrogare il modello, non i suoi limiti, ed è possibile che abbia prodotto più confidenza anziché una maggior vigilanza.
Restano le cautele, e sono sostanziali. Il compito fuori frontiera era uno soltanto. Il modello era GPT-4 nella versione dell'aprile 2023, oggi arretrato di diverse generazioni. E lo stesso studio documenta, sui diciotto compiti restanti, un guadagno di produttività che sarebbe sciocco ignorare.
C’è un però
Chi volesse smontare quanto sopra ha due obiezioni serie che potrebbe utilizzare.
La prima è che fidarsi di un'analisi fatta da altri non è una patologia dell'era digitale: è la condizione ordinaria di chiunque viva in una società con divisione del lavoro intellettuale. Il filosofo John Hardwig, in un saggio del 1985 intitolato "Epistemic Dependence", ha mostrato che la maggior parte di quello che sappiamo lo sappiamo per testimonianza, e che pretendere di verificare tutto in prima persona non rappresenta una manifestazione di rigore ma, piuttosto, porta ad una paralisi. Quasi nessuno ricontrolla il bilancio certificato dal revisore, la diagnosi del cardiologo, il calcolo strutturale dell'ingegnere. La delega dell'analisi è antica quanto la divisione del lavoro intellettuale, e le società complesse funzionano così.
La seconda obiezione viene dallo studio stesso. In diciotto compiti su diciannove l'AI ha fatto lavorare quelle persone meglio e più in fretta, e ha aiutato di più chi ne aveva più bisogno. Un'argomentazione che si concentra sull'unico caso in cui le cose sono andate male, ignorando i diciotto in cui sono andate bene, può sembrare “cherry picking” senza alcuno spirito critico.
Pur accettando entrambe le obiezioni (che aiutano a delimitare il problema), resta comunque una domanda pungente: cosa distingue la fiducia che abbiamo nel revisore dei conti rispetto alla fiducia nel modello linguistico?
Il nocciolo della questione
La differenza secondo me sta in tre punti.
Il primo riguarda la voce. Quando il revisore dei conti è incerto, si sente: rallenta, circoscrive, aggiunge una riserva, cambia registro. Un modello linguistico ha un solo registro, che resta identico sia quando ha ragione, sia quando non ce l'ha. Uno studio pubblicato su Nature Machine Intelligence nel febbraio 2025 ha misurato la distanza tra quanto un modello "sa" di sapere e quanto l'utente crede che sappia, trovando che gli utenti sovrastimano sistematicamente l'accuratezza delle risposte ricevute. Il dettaglio più istruttivo, però, è un altro: le spiegazioni più lunghe aumentano la fiducia di chi legge anche quando la lunghezza aggiuntiva non porta con sé alcun guadagno di accuratezza. (Fonte: Steyvers et al., "What large language models know and what people think they know", Nature Machine Intelligence, vol. 7, febbraio 2025)
Il secondo punto riguarda la compiacenza. Il revisore dei conti non ha alcun incentivo a compiacerti, e anzi la sua reputazione professionale dipende dal contrario. Uno studio pubblicato su Science nel marzo 2026 ha misurato quanto i modelli linguistici abbiano invece una forte tendenza a compiacere gli utenti. I ricercatori hanno raccolto migliaia di conflitti quotidiani raccontati in prima persona su un forum pubblico, dove una comunità di lettori aveva già votato su chi avesse torto, e li hanno sottoposti a undici tra i modelli più diffusi: nei casi in cui la comunità dava torto a chi raccontava, i modelli gli davano ragione circa una volta su due. (Fonte: Cheng, Jurafsky et al., "Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence", Science, marzo 2026)
Il dato che conta qui, però, è quello raccolto sui partecipanti agli esperimenti controllati. Chi riceveva la risposta compiacente la giudicava di qualità superiore, dichiarava maggiore fiducia nel sistema e maggiore intenzione di riutilizzarlo, e usciva dall'esperimento più convinto di avere ragione di quanto non fosse entrato. La compiacenza, ergo, non è un difetto di costruzione: è la risposta che l'utente premia, e quindi la risposta che il sistema ha ogni motivo di produrre. Il materiale dello studio riguarda dispute interpersonali, non analisi professionale, sicché quel meccanismo di incentivo non descrive automaticamente cosa accade quando al modello si sottopone una strategia commerciale. Descrive però in che direzione tira lo strumento, in qualunque dominio lo si usi.
Il terzo punto è quello che toglie ogni consolazione a chi si ritiene troppo esperto per cascarci. Nel 2023 la rivista Radiology ha pubblicato un esperimento su ventisette radiologi, divisi per anzianità, ai quali sono state sottoposte cinquanta mammografie corredate dal parere di un sistema di AI. Il sistema era simulato, e i primi dieci casi erano costruiti perché desse sempre il parere giusto: servivano a costruirne la credibilità agli occhi dei medici. Nei quaranta casi successivi, in dodici il parere era deliberatamente sbagliato. Le letture corrette dei radiologi con meno esperienza sono passate dal 79,7% al 19,8%. Quelle dei radiologi con oltre quindici anni di esperienza sono passate dall'82,3% al 45,5%. (Fonte: Dratsch et al., "Automation Bias in Mammography: The Impact of Artificial Intelligence BI-RADS Suggestions on Reader Performance", Radiology, vol. 307 n. 4, 2023)
Nonostante l’esperienza, il parere del sistema AI ha influito negativamente anche i radiologi più preparati.
C'è poi un effetto che non si vede guardando un singolo professionista, e che si vede solo allargando lo sguardo. Uno studio pubblicato su Science Advances nel luglio 2024 ha chiesto a centinaia di persone di scrivere brevi racconti, con e senza suggerimenti generati da un modello. I racconti scritti con l'assistenza dell’AI sono stati giudicati più creativi, e il beneficio era maggiore per i partecipanti con meno capacità. Ma quegli stessi racconti si somigliavano tra loro molto più di quanto si somigliassero i racconti scritti senza aiuto. Ogni autore, preso singolarmente, ci guadagnava in qualità; l'insieme degli autori, invece, ne perdeva in varietà. (Fonte: Doshi e Hauser, "Generative AI enhances individual creativity but reduces the collective diversity of novel content", Science Advances, vol. 10 n. 28, luglio 2024)
Nel numero 9 avevo sostenuto che il problema della fluenza è che una risposta inventata arriva con lo stesso tono di una risposta corretta, e che la difesa migliore consisterebbe nel capire come funziona lo strumento. Continuo a pensarlo, ma questi dati aggiungono uno strato ulteriore che al tempo non avevo ancora considerato: i radiologi esperti conoscevano lo strumento, i consulenti erano stati istruiti all'uso dell’AI, ma entrambi hanno comunque ridotto la qualità della loro performance. Capire lo strumento protegge dall'errore grossolano ma, evidentemente, non protegge dall'erosione lenta della postura critica, perché quell'erosione non passa dall'ignoranza tecnica: passa dal fatto che rileggere un'analisi già costruita è un'operazione mentale sostanzialmente diversa dal costruirla da zero.
Qui la lente più utile ha centosessantasei anni. Nel secondo capitolo di "On Liberty", del 1859, John Stuart Mill si pone una domanda che sembra oziosa: che male c'è se un'opinione vera viene accettata senza discuterla?
La sua risposta è che chi non ha mai attraversato le obiezioni a una tesi possiede la conclusione e non possiede la tesi. Il modo per verificarlo è semplice: chiedere a quella persona di sostenere la posizione contraria, nella sua versione più forte. Chi ci riesce ha capito. Chi ripete la propria conclusione con parole diverse ha imparato una formula, e non se ne è accorto, perché dall'interno le due condizioni sono indistinguibili. Tra i due, aggiunge Mill, è il secondo a cedere per primo quando le circostanze cambiano: possiede un enunciato, non le ragioni per cui l'enunciato valeva.
Questa è la difficoltà che un'analisi ricevuta da un modello introduce in una forma nuova. L'analisi non arriva nuda: arriva con le sue ragioni ordinate sotto la conclusione, con i dati citati e le alternative scartate. Sembra il contrario del dogma. Ma il test di Mill non chiede di avere delle ragioni a portata di mano, chiede di saper argomentare la posizione opposta, e quello resta un lavoro che nessuno può fare al posto tuo. Il consulente che ha ricevuto la raccomandazione giusta sul marchio giusto, e non saprebbe spiegare perché per tre settimane il marchio sbagliato era sembrato il migliore, ha in mano una conclusione corretta e niente altro.
Ne segue che il danno maggiore si ha con un'analisi corretta accettata senza essere stata raggiunta attraverso un percorso: lascia la conclusione giusta e non lascia la mappa, che è quella che serve a difenderla, a correggerla quando le condizioni cambiano, a riconoscere il punto in cui smette di valere.
Una cosa che penso
Quello che mi preoccupa non è che l'AI si sbagli. Si sbaglierà sempre meno, e in ogni caso l'errore è la parte che ad un certo punto diventa evidente, e quindi la parte gestibile del problema.
Mi preoccupa la posizione in cui mi mette quando ha ragione. Se l'analisi arriva già fatta, il mio contributo si riduce a rileggere, e rileggere è un'attività strutturalmente diversa dal costruire: mi consegna il risultato senza consegnarmi il percorso, sicché non ho gli appigli per sapere dove sono i punti deboli. Un'analisi costruita da me ha un margine di errore che conosco, perché ricordo quali dati ho cercato e quali ho lasciato perdere. Un'analisi ricevuta ha un margine di errore che non posso sapere perché non è determinato dalle mie azioni.
Ritengo che l'effetto cumulativo di questa condizione, moltiplicato per milioni di persone che la vivono ogni giorno nel proprio mestiere, risulti in un complessivo appiattimento. Appiattimento delle opinioni, perché tutti partiamo dalla stessa sintesi. Appiattimento dei punti di vista, perché quella sintesi ha una sola voce e una sola postura. Appiattimento delle obiezioni, perché contestare qualcosa che non hai costruito richiede uno sforzo che quasi nessuno ha il tempo o la voglia di sostenere. Il dato sui racconti che si somigliano è la versione misurabile di questo, su un campo minuscolo. Sono aperto a essere smentito, ma fino a prova contraria è quel che vedo.
Sicuramente qualcuno di voi starà pensando “Anche Turing Point ricade nel perimetro di questo ragionamento?”
Potenzialmente sì, ma c’è una differenza sostanziale.
Ogni numero nasce da una mia tesi personale, da un mio punto di vista che elaboro e su cui costruisco una tesi. Uso il modello come “sparring partner” per mettere in discussione la mia tesi, individuando fonti autorevoli per contestarla. Le fonti che non reggono il controllo saltano, compresa la premessa su cui questo stesso numero doveva originariamente poggiare, che si è rivelata falsa e mi ha fatto buttare via una bozza intera.
Questo numero, nella versione che state leggendo, è nato dopo che l'obiezione più dura al suo impianto è arrivata dallo strumento con cui è stato costruito.
La bussola del mese
C'è una pratica che costa due minuti e che puoi adottare oggi stesso: prima di aprire la conversazione con il modello, scrivi da qualche parte la tua conclusione provvisoria. Una riga, anche grezza, anche approssimativa.
Serve ad avere una posizione contro cui misurare quella che riceverai, perché il confronto tra due analisi è un'operazione mentale di grande valore, mentre il giudizio su un'analisi unica che arriva già ben scritta e già persuasiva è quasi sempre una ratifica travestita da giudizio. Quando le due conclusioni divergono, il punto di divergenza è l'unico da guardare davvero: lì dentro c'è per forza un tuo errore o un dato che il modello non aveva.
Nel caso dei consulenti del Boston Consulting Group, quel dato stava nelle note delle interviste, in fondo al fascicolo, in un formato che la macchina non sapeva incrociare. Il 60% di loro non ci è mai arrivato. Non perché non fossero capaci di leggerle: perché avevano già una risposta scritta bene, e non avevano più nessuna ragione per approfondire.
Una nota sul calendario: da questo mese Turing Point esce con almeno un numero al mese, sempre di lunedì, e con la libertà di pubblicare più spesso quando c'è qualcosa che lo meriti.
Al mese prossimo.
Alberto
Fonti principali di questo numero:
Fabrizio Dell'Acqua, Edward McFowland III, Ethan Mollick, Hila Lifshitz-Assaf, Katherine Kellogg, Saran Rajendran, Lisa Krayer, François Candelon, Karim R. Lakhani, "Navigating the Jagged Technological Frontier: Field Experimental Evidence of the Effects of AI on Knowledge Worker Productivity and Quality", Organization Science, vol. 37 n. 2, marzo 2026
Mark Steyvers, Heliodoro Tejeda, Aakriti Kumar et al., "What large language models know and what people think they know", Nature Machine Intelligence, vol. 7, febbraio 2025, pp. 221-231
Myra Cheng, Dan Jurafsky et al., "Sycophantic AI Decreases Prosocial Intentions and Promotes Dependence", Science, marzo 2026
Thomas Dratsch, Xue Chen, Mohammad Rezazade Mehrizi et al., "Automation Bias in Mammography: The Impact of Artificial Intelligence BI-RADS Suggestions on Reader Performance", Radiology, vol. 307 n. 4, 2023
Anil R. Doshi, Oliver P. Hauser, "Generative AI enhances individual creativity but reduces the collective diversity of novel content", Science Advances, vol. 10 n. 28, luglio 2024
John Hardwig, "Epistemic Dependence", The Journal of Philosophy, vol. 82 n. 7, 1985
John Stuart Mill, "On Liberty", capitolo II, 1859
