I modelli linguistici possono accelerare ricerca, confronto e analisi delle informazioni, ma non sono database della conoscenza e possono produrre affermazioni o riferimenti inesistenti
Dal funzionamento degli LLM alla Retrieval-Augmented Generation: perché l’intelligenza artificiale può diventare un potente strumento per il giornalismo scientifico soltanto mantenendo verifica delle fonti e responsabilità umana
L’intelligenza artificiale generativa sta entrando stabilmente nel giornalismo, nella ricerca e nella comunicazione scientifica. Può analizzare grandi quantità di testo, confrontare documenti, sintetizzare studi, tradurre contenuti, individuare relazioni e assistere nella costruzione di un articolo.
Ma che cosa accade realmente quando chiediamo a un Large Language Model, un LLM, di rispondere a una domanda ? Comprendere almeno nelle linee fondamentali il funzionamento di questi sistemi è essenziale per stabilire che cosa possiamo ragionevolmente chiedere loro e, soprattutto, quali risultati dobbiamo verificare.
La questione riguarda direttamente anche SRM – Science and Religion in Media, come anticipato nel mese di febbraio 2026 nell’articolo Il metodo SRM : data journalism, analisi critica e intelligenza artificiale per comprendere scienza, media e società. Supervisionando output e pubblicazione, utilizziamo IA come ChatGPT, Gemini, Claude e altre, ad esempio per produrre immagini e video, analizzare grandi quantità di dati, effettuare sintesi, produrre in alcuni casi testi, etc.
Fede e Ragione ha ieri nuovamente descritto e spiegato il proprio metodo di utilizzo dell’intelligenza artificiale, chiarendo un principio fondamentale: gli strumenti di IA possono essere utilizzati nella ricerca e nell’elaborazione dei contenuti, ma le pubblicazioni non sono processi automatici e rimangono sottoposte a supervisione e responsabilità umana. Leggi Fede e Ragione e l’intelligenza artificiale : strumento per il giornalismo, non sostituto della responsabilità umana.
Per una rivista scientifica come SRM la domanda può essere portata a un livello ulteriore: perché questa supervisione è necessaria dal punto di vista tecnico e scientifico?
Che cosa fa realmente un Large Language Model ?
Un LLM non funziona come un’enciclopedia tradizionale e nemmeno, in senso stretto, come un database nel quale a ogni domanda corrisponde un’informazione precedentemente archiviata. I moderni modelli linguistici sono reti neurali addestrate su enormi quantità di dati testuali. Durante l’addestramento apprendono regolarità statistiche estremamente complesse presenti nel linguaggio.
Semplificando molto, durante la generazione di un testo il modello calcola distribuzioni di probabilità sui possibili token successivi — dove un token può corrispondere a una parola, a una sua parte o ad altri elementi della sequenza — sulla base del contesto precedente.
Questo meccanismo consente risultati sorprendenti. Un modello sufficientemente grande può riassumere documenti, tradurre, classificare informazioni, produrre codice, confrontare argomentazioni e svolgere numerosi compiti che richiedono apparentemente forme sofisticate di ragionamento.
Ma esiste una conseguenza fondamentale: il meccanismo che produce una frase linguisticamente plausibile non garantisce, da solo, che quella frase sia vera. Probabilità linguistica e verità fattuale sono due proprietà differenti.
Perché un’IA può inventare una fonte perfettamente credibile
Da questa caratteristica deriva il fenomeno comunemente definito hallucination, o allucinazione. Un modello può produrre un’affermazione falsa, attribuire una frase alla persona sbagliata oppure generare il titolo di uno studio scientifico che non è mai esistito.
Il risultato può essere particolarmente insidioso perché spesso possiede tutte le caratteristiche esteriori della credibilità: nome plausibile dell’autore, titolo verosimile, rivista realmente esistente e persino una struttura apparentemente corretta del riferimento bibliografico.
Non si tratta soltanto di un rischio teorico. Uno studio pubblicato nel 2023 su Scientific Reports ha analizzato 636 riferimenti bibliografici prodotti da GPT-3.5 e GPT-4 nell’ambito di 84 testi generati su differenti argomenti, documentando il problema delle citazioni bibliografiche fabbricate e degli errori nei riferimenti.
Il punto metodologico è essenziale per il giornalismo scientifico: un riferimento prodotto da un modello non dovrebbe essere considerato una fonte fino a quando la sua esistenza e il suo contenuto non siano stati verificati.
Il problema non è stato eliminato dai modelli più avanzati
Si potrebbe pensare che le allucinazioni siano semplicemente un difetto delle prime generazioni di chatbot destinato a scomparire con l’aumento delle dimensioni e delle capacità dei modelli. La ricerca suggerisce una situazione più complessa.
Nel 2026 uno studio pubblicato su Nature ha analizzato il rapporto tra sistemi di valutazione e produzione di risposte errate, mostrando come alcuni criteri utilizzati per premiare l’accuratezza possano paradossalmente incentivare i modelli a fornire una risposta anche quando sarebbe epistemicamente preferibile ammettere l’incertezza.
Il problema quindi non consiste semplicemente nel costruire modelli “più intelligenti”. Bisogna anche progettare sistemi capaci di riconoscere quando le informazioni disponibili non consentono una risposta sufficientemente affidabile.
Per il giornalismo la lezione è ovvia : una risposta completa e ben formulata non deve essere automaticamente preferita a un’incertezza dichiarata. “Non lo sappiamo” può essere una risposta informativamente migliore di una spiegazione convincente ma falsa.
LLM come database o come motori di ragionamento ?
Una distinzione particolarmente interessante è stata proposta sulle pagine di Nature Medicine i Large Language Models non dovrebbero essere considerati principalmente database della conoscenza, ma strumenti capaci di assistere processi di ragionamento e inferenza.
È una distinzione estremamente utile anche per comprendere quale possa essere il loro ruolo nel giornalismo scientifico. Chiedere semplicemente : Qual è lo studio che dimostra X ? e accettare il riferimento prodotto significa affidare al modello una funzione per la quale la generazione linguistica non offre automaticamente garanzie sufficienti.
Differente è fornire al sistema studi reali e verificati e chiedergli: “Confronta metodologie, campioni, risultati e limiti di questi lavori”. Nel secondo caso l’IA viene utilizzata come strumento di analisi di un corpus documentale definito. È un cambiamento apparentemente piccolo, ma epistemologicamente fondamentale.
Retrieval-Augmented Generation : collegare il modello alle fonti
Uno dei principali approcci sviluppati per ridurre questi problemi è la Retrieval-Augmented Generation, normalmente indicata con l’acronimo RAG. In un sistema RAG il modello non deve affidarsi esclusivamente ai parametri appresi durante l’addestramento. Prima di produrre la risposta viene effettuata una ricerca in una raccolta di documenti o in altre fonti esterne; i contenuti recuperati vengono quindi forniti al modello come contesto per la generazione.
Il principio è semplice: domanda → ricerca delle informazioni → recupero dei documenti pertinenti → generazione della risposta basata sui documenti recuperati.
Questo approccio non elimina automaticamente gli errori. Il sistema può recuperare documenti poco pertinenti, interpretarli male oppure produrre conclusioni non pienamente sostenute dalle fonti. Ma introduce qualcosa di fondamentale: il grounding, cioè l’ancoraggio della risposta a informazioni esterne verificabili.
Che cosa ci dicono gli esperimenti scientifici
Un lavoro pubblicato su Nature nel febbraio 2026 ha affrontato proprio il problema della sintesi automatizzata della letteratura scientifica attraverso modelli linguistici dotati di retrieval.
I ricercatori hanno sviluppato OpenScholar, un sistema progettato per recuperare letteratura scientifica e produrre risposte corredate da riferimenti. Negli esperimenti descritti nello studio, GPT-4o utilizzato senza questo sistema generava citazioni inesistenti in una percentuale molto elevata nei compiti considerati, mentre l’architettura basata su recupero delle fonti e meccanismi di feedback migliorava sensibilmente correttezza e accuratezza delle citazioni.
Il risultato non significa che un sistema RAG sia automaticamente affidabile. Dimostra però qualcosa di molto importante: l’architettura con cui utilizziamo un modello può essere importante quanto il modello stesso. Un LLM isolato al quale chiediamo di ricordare una fonte e un sistema che prima ricerca quella fonte in un corpus scientifico verificabile stanno svolgendo due operazioni epistemicamente differenti.
Anche le revisioni della letteratura richiedono cautela
Il problema diventa ancora più evidente quando l’IA viene utilizzata per sintetizzare la letteratura scientifica. Una review pubblicata nel 2025 su AI & Society, basata sull’analisi di 124 studi, ha evidenziato un quadro molto eterogeneo: l’IA generativa può produrre significativi guadagni di efficienza in alcune fasi delle revisioni della letteratura, ma accuratezza e affidabilità variano fortemente a seconda del compito. Nei lavori analizzati, i problemi di hallucination potevano diventare molto rilevanti, soprattutto nelle attività che richiedevano sintesi e interpretazioni più complesse.
È una distinzione importante. Individuare determinate parole in mille abstract è un compito diverso dal decidere quale interpretazione scientifica emerga complessivamente da quegli stessi mille studi. Nel primo caso l’automazione può essere relativamente semplice da verificare. Nel secondo entrano in gioco qualità metodologica degli studi, dimensione dei campioni, significatività statistica, possibili bias, risultati contraddittori e forza complessiva dell’evidenza. La sintesi scientifica non consiste nella semplice somma dei testi.
Un problema di incertezza
Una delle aree di ricerca più interessanti riguarda proprio la possibilità di stimare quando un modello sia incerto sulla risposta. Nel 2024 un gruppo di ricercatori ha presentato su Nature un metodo basato sulla semantic entropy, l’entropia semantica, per individuare determinate forme di confabulazione negli LLM.
L’idea, semplificando, è osservare non soltanto quanto siano probabili determinate sequenze linguistiche, ma quanto siano semanticamente differenti le possibili risposte prodotte dal modello. Una forte variabilità nel significato può costituire un segnale di incertezza.
È un campo particolarmente significativo perché introduce nell’IA una domanda che appartiene da sempre alla metodologia scientifica: quanto siamo sicuri di ciò che affermiamo? La scienza non comunica soltanto risultati. Comunica intervalli di confidenza, margini di errore, probabilità, limiti metodologici e livelli di evidenza.
Un’intelligenza artificiale destinata ad assistere seriamente la comunicazione scientifica dovrebbe quindi essere valutata non soltanto sulla capacità di rispondere, ma anche sulla capacità di rappresentare correttamente l’incertezza.
Dalla generazione alla verifica
Possiamo allora distinguere almeno tre livelli nell’impiego giornalistico dell’IA. Il primo è generativo: produrre testo, titoli, sintesi, traduzioni o ipotesi. Il secondo è analitico: confrontare documenti, estrarre informazioni, individuare relazioni, classificare dati.
Il terzo è epistemico: stabilire se un’affermazione è sufficientemente sostenuta dalle evidenze disponibili. È soprattutto quest’ultimo livello che non dovrebbe essere delegato automaticamente.
Se un modello afferma che uno studio ha dimostrato una determinata correlazione, il controllo giornalistico dovrebbe risalire allo studio. Se viene citata una statistica, occorre verificare il dataset o l’istituzione che l’ha prodotta. Se viene riportata una sentenza, il riferimento ultimo deve essere il provvedimento giudiziario e non il riassunto generato dal sistema. L’IA può rendere molto più rapido il percorso verso la fonte. Non deve sostituire la fonte.
Il metodo scientifico come modello per il giornalismo assistito dall’IA
Da questo punto di vista, il giornalismo scientifico possiede già molti degli strumenti culturali necessari per utilizzare correttamente l’intelligenza artificiale. Il metodo scientifico richiede infatti che un’affermazione possa essere controllata, che le procedure siano descrivibili, che i risultati possano essere messi in discussione e che esista una distinzione tra ipotesi ed evidenza.
Applicati al giornalismo assistito dall’IA, questi principi suggeriscono un metodo molto concreto: fonte primaria → analisi assistita dall’IA → confronto con altre fonti → verifica umana → pubblicazione.
Non: domanda all’IA → risposta → pubblicazione.
La differenza tra i due processi rappresenta probabilmente una delle questioni decisive per il futuro dell’informazione.
La responsabilità non è una proprietà statistica
C’è infine un limite che non riguarda soltanto la tecnologia. Un modello può calcolare probabilità. Può essere ottimizzato per ridurre gli errori. Può confrontare migliaia di documenti in pochi secondi. Può persino essere progettato per segnalare la propria incertezza. Ma non è per questo il soggetto che assume la responsabilità editoriale di ciò che viene pubblicato.
Anche Nature Methods, discutendo nel 2026 l’impiego dell’IA nell’editoria scientifica, ha ribadito un principio significativo: gli strumenti generativi non possono essere indicati come autori perché non possono assumersi la responsabilità del contenuto di un manoscritto; i testi prodotti con assistenza dell’IA devono comunque essere accuratamente verificati.
E proprio il 20 agosto 2026 Nature Computational Science ha nuovamente sottolineato come trasparenza, accountability e supervisione umana rimangano essenziali mentre l’IA entra sempre più profondamente nel ciclo della ricerca e della pubblicazione scientifica.
Più intelligenza artificiale richiede più metodo scientifico
Il punto, quindi, non è scegliere tra giornalismo umano e giornalismo artificiale. È capire come costruire sistemi ibridi nei quali capacità computazionale e giudizio umano svolgano funzioni differenti.
L’intelligenza artificiale può aumentare enormemente la quantità di informazioni che una redazione o un ricercatore riescono ad analizzare. Può ridurre il tempo necessario per confrontare documenti e rendere accessibili conoscenze specialistiche attraverso traduzione, sintesi e interrogazione del testo.
Ma proprio perché abbassa drasticamente il costo della produzione di informazioni, aumenta il valore della verifica. Nell’era dell’IA la competenza fondamentale potrebbe quindi non essere più soltanto saper trovare una risposta.
Sarà sempre più importante sapere da dove proviene, su quali evidenze si fonda, quale livello di incertezza contiene e che cosa potrebbe smentirla. È la stessa disciplina intellettuale sulla quale la scienza ha costruito una parte fondamentale della propria affidabilità.
E forse è proprio questo il paradosso più interessante dell’intelligenza artificiale generativa: più diventano potenti le macchine che producono risposte, più abbiamo bisogno del metodo scientifico per capire quali risposte possiamo considerare vere.
Immagine elaborata con Intelligenza Artificiale.
Lascia una risposta
Devi essere connesso per inviare un commento.