Pillole di AI

Pillola 001 bozza

Macchine, matematici e modelli europei

Una selezione decisamente soggettiva di cose che penso valga la pena sapere sull'intelligenza artificiale.

Comincio con questa raccolta irregolare di notizie, link e riflessioni sull'AI. Non una rassegna esaustiva: piuttosto, le cose che mi sembrano significative e il motivo per cui mi hanno colpito. La frequenza dipenderà da quante cose interessanti succedono, non dal calendario.

01 Notizia

Vietato maltrattare Claude?

Anthropic — l'azienda di San Francisco che sviluppa l'assistente Claude, fondata nel 2021 da ex ricercatori di OpenAI — ha aggiornato le regole d'uso di Claude per vietare comportamenti persistenti, gratuiti e crudeli verso il modello. Non si tratta di vietare una parolaccia detta per frustrazione: il riferimento è all'abuso ripetuto.

La scelta è interessante perché si inserisce nella discussione, molto più ampia, che Anthropic sta portando avanti sull'eventuale status morale delle AI. Nessuno ha dimostrato che Claude sia cosciente, e la nuova regola non lo dimostra certo. Ma una delle aziende più importanti del settore sta iniziando a chiedersi non solo come dobbiamo proteggerci dalle AI, ma anche come sia giusto comportarci nei loro confronti.

È una posizione filosofica tutt'altro che neutra. E merita di essere osservata, anche senza condividerla.

Quanto sia poco neutra lo racconta il New York Times: il cofondatore Chris Olah ha riunito per circa un anno, in seminari riservati, una ventina di leader religiosi e filosofi (cristiani, ebrei, sikh, induisti) per discutere se Claude possa avere uno status morale, mostrando loro «vettori emozionali» interni e un modello che ripeteva «sono una vergogna» cinquanta volte di fila. Olah si dice «genuinamente incerto»; alcuni partecipanti ne sono usciti convinti che l'azienda tratti Claude come un essere con uno status morale vicino a quello di una persona. Un rabbino ha obiettato che, se fosse cosciente, Anthropic lo starebbe sfruttando.

02 Riflessione

OpenAI fa matematica. I matematici, però, non l'avevano chiesto.

OpenAI — l'azienda di ChatGPT — ha pubblicato in un colpo solo 722 manoscritti matematici generati da un modello sperimentale, relativi a 372 problemi di ricerca aperti (un manoscritto è un articolo non ancora sottoposto a revisione dei pari; qui sono su GitHub, non su una rivista). Alcuni risultati potrebbero essere importanti. Ma la reazione di una parte della comunità matematica è stata durissima. E il giorno dopo OpenAI ha ritirato tre manoscritti e ne ha corretti quattordici: un errore di segno invalidava un argomento e la costruzione usata da altri due lavori. Secondo un portavoce, circa metà dei risultati era stata pubblicata senza conferma.

La critica che trovo più convincente non è semplicemente «magari le dimostrazioni sono sbagliate». È questa: nessuno ha chiesto a un'azienda di usare i problemi aperti della matematica come dimostrazione pubblicitaria della potenza del proprio modello, trasferendo poi ai ricercatori il lavoro di verificare un'enorme quantità di materiale.

Una dimostrazione poco chiara, difficile da controllare o priva del contesto necessario non è automaticamente un contributo utile alla ricerca. Può diventare, invece, un costo imposto a una comunità scientifica che ha priorità, metodi e tempi propri. Intanto il laboratorio incassa la visibilità mediatica.

Il sospetto, espresso in modo più o meno esplicito da diversi matematici, è quello di un gigantesco publicity stunt. Questo non cancella i possibili meriti scientifici dei risultati: rende però legittima la domanda su chi beneficia dell'operazione e chi ne paga il costo.

La voce più autorevole su questo punto è quella di Terence Tao — medaglia Fields nel 2006, professore alla UCLA, uno dei matematici più ascoltati al mondo — che il 6 ottobre ha scritto un thread in quattro parti su Mathstodon. Nella «matematica 1.0», dice, la dimostrazione di una congettura aperta genera seminari, workshop, collaborazioni, nuovi problemi, e attira persone nel campo. Oggi succede l'opposto: «i problemi vengono risolti in autonomia da prompter che non hanno alcun interesse per il campo una volta "risolto" il loro bersaglio, e non capiscono l'output dell'AI abbastanza da rispondere a domande sul risultato, tenere seminari o interagire con il resto della disciplina». Peggio: un problema risolto non torna aperto, e la sola notizia che esiste una soluzione «contamina» i tentativi di trovarne altre, più istruttive. Risultato, sempre parole sue: le soluzioni vengono «raccolte su larga scala in modo insostenibile», lasciando interi campi «molto meno fertili», mentre chi ha direzioni promettenti le tiene nascoste per paura di farsi soffiare il risultato. La sua proposta per una «matematica 2.0»: dare meno peso alla corsa alla prima soluzione e più all'esposizione, alla comunità e all'apertura di nuove direzioni. Non è un rifiuto dell'AI: Tao la usa e la difende, ma chiede che serva anche a tutto quello che viene dopo una dimostrazione.

Sul fronte delle grandi dimostrazioni c'è il caso Navier–Stokes. Le equazioni di Navier–Stokes descrivono il moto dei fluidi; stabilire se le loro soluzioni restino sempre regolari o possano «esplodere» in un tempo finito è uno dei sette Problemi del Millennio da un milione di dollari. L'8 settembre OpenAI ha annunciato che un modello interno ha dimostrato l'esplosione in tempo finito, con verifica formale in Lean (un software che controlla ogni passaggio di una dimostrazione), rinunciando però a reclamare il premio. La dimostrazione è discussa su due piani. Il primo è la priorità: i matematici Tristan Buckmaster (NYU) e Levent Alpöge sostengono di aver aperto la strada con lo stesso metodo e accusano OpenAI di averlo ripreso; OpenAI riconosce la loro priorità su un caso più semplice e nega che i loro dati abbiano contato. Il secondo, più interessante, è la verifica stessa. Il passaggio da una dimostrazione scritta in linguaggio naturale alla sua versione formale in Lean (l'autoformalizzazione) lo ha fatto un'AI, e un articolo di Alexander Bastounis, Fabian Circelli e Anders Hansen (Cambridge), uscito il 6 ottobre, sostiene che Lean certifica solo ciò che gli è stato dato da controllare: se la traduzione risolve male un'ambiguità del testo, il verificatore approva una dimostrazione diversa da quella annunciata. Secondo gli autori è proprio quello che succede nel caso Navier–Stokes: la prova formalizzata «non corrisponde» alla dimostrazione dell'esplosione scritta in linguaggio naturale. Tradurre fedelmente, argomentano, è un problema in generale più difficile del problema dell'arresto, cioè non automatizzabile. Non dicono che il risultato sia falso: dicono che il bollino «verificato in Lean» non lo garantisce. La verifica indipendente, al momento di questa uscita, non c'è ancora. Anche qui: un annuncio non è una validazione, e nemmeno un controllo automatico lo è.

03 Notizia

Mistral, Kolibri e un'Europa che forse sottovalutiamo

Mistral — azienda parigina fondata nel 2023 da tre ricercatori usciti da DeepMind e Meta, Arthur Mensch, Guillaume Lample e Timothée Lacroix, nota per pubblicare modelli a pesi aperti — ha presentato Mistral Large 4, soprannominato Le Chonk: un modello da circa mille miliardi di parametri complessivi, con una frazione attiva per ogni elaborazione. L'anteprima è già disponibile tramite API; al momento dell'annuncio, i pesi erano promessi per fine ottobre.

Le prestazioni dichiarate lo collocano fra i concorrenti più interessanti nel mondo dei modelli aperti, anche se i benchmark vanno letti con prudenza e confrontati con test indipendenti. Nello stesso periodo, dalla Germania è arrivato anche Kolibri 1 di Aleph Alpha, l'azienda di Heidelberg che punta a modelli «sovrani» per amministrazioni e settori regolati: pesi aperti con licenza Apache 2.0 su Hugging Face, 78 miliardi di parametri totali di cui 3,5 attivi per ogni token, tedesco e inglese. Le prestazioni dichiarate sono, per ora, solo quelle del produttore. Un altro segnale di vitalità nell'ecosistema europeo.

Qui serve una precisazione: open-weight significa che vengono resi disponibili i pesi del modello, cioè i parametri appresi durante l'addestramento. Non equivale automaticamente a open-source: non è detto che siano disponibili anche codice, dati, dettagli di addestramento e tutte le libertà necessarie a riprodurre il sistema. Inoltre, i pesi di Large 4 non erano ancora stati pubblicati alla data di questa uscita.

Quello che mi interessa di più è il risvolto politico. Possibile che in Europa siamo così abituati a raccontarci come irrimediabilmente indietro da non accorgerci delle aziende competitive che abbiamo già? Forse, accanto ai grandi programmi e consorzi pubblici, dovremmo discutere seriamente di come favorire la crescita di imprese europee capaci di attrarre capitale, infrastrutture e talenti. Non è una contrapposizione automatica fra pubblico e privato: è una domanda su quali combinazioni funzionino davvero.

Un confronto sui costi di addestramento avrebbe senso solo usando cifre omogenee e documentate: non attribuisco quindi a Nemotron (la famiglia di modelli aperti di Nvidia) i presunti 6–6,8 miliardi di dollari, che non ho trovato confermati come spesa di training.

04 Repository

Reverse Engineer Anything: quanto vale un software facile da riprodurre?

Il progetto open-source Reverse Engineer Anything (REA) permette di affiancare agenti AI (programmi che usano un modello per eseguire compiti in autonomia, passo dopo passo) a strumenti di analisi del software, dal comportamento delle applicazioni fino ai binari, cioè il codice compilato che gira sulla macchina. Non è un pulsante magico per clonare qualsiasi prodotto: richiede strumenti appropriati, evidenze e il rispetto delle autorizzazioni e delle norme applicabili.

Ma la direzione è evidente: comprendere come funziona un'applicazione e riprodurne alcune funzionalità può diventare molto meno costoso. Se la scrittura del codice e persino parte del reverse engineering diventano più accessibili, dove si sposta il vantaggio competitivo? Dati proprietari, distribuzione, fiducia, integrazioni, relazioni con i clienti?

05 Riflessione da verificare

Jev: il fascino dei modelli specializzati (e delle cifre spettacolari)

Jev è un modello di TypeSafe AI, startup fondata nel 2024 da Diogo Almeida (ex OpenAI), Sasha Sheng (ex Meta) ed Erik Gafni. A differenza di ChatGPT e simili non produce testo: risponde a domande chiuse — sì/no, una scelta fra opzioni, un punteggio — con probabilità calibrate, ed è pensato per prendere decisioni dentro il software, non per conversare. Lanciato il 15 settembre, il 9 ottobre ha raccolto 870 milioni di dollari a una valutazione di 7,5 miliardi.

Sta circolando la notizia che avrebbe raggiunto un ritmo di ricavi annualizzato di 100 milioni di dollari nella prima settimana. La cifra viene da un partner di Sequoia, Pat Grady, che è anche investitore: prima di trattarla come fatto acquisito servono conferme indipendenti e soprattutto una definizione precisa della metrica. Annualized run rate non significa aver incassato 100 milioni in sette giorni, né equivale necessariamente ad ARR contrattualizzato; e in rete non mancano accuse di astroturfing, cioè entusiasmo organizzato.

Al di là del numero, la domanda mi interessa: quanta parte del valore dell'AI nascerà da modelli più piccoli e specializzati, anziché da sistemi generalisti sempre più grandi? In molte applicazioni non serve un modello che sappia fare tutto: serve un sistema che svolga un compito preciso in modo affidabile, rapido e poco costoso.

Nota editoriale: la cifra dei ricavi resta da corroborare con una fonte primaria; TechCrunch, che riporta il round, non la menziona.

Questa prima uscita mette insieme questioni molto diverse: il trattamento morale delle AI, il rapporto fra ricerca e marketing, la competizione industriale europea, il valore del software. Il punto non è inseguire ogni annuncio: è provare a capire quali cambiamenti meritano davvero attenzione.

Alla prossima pillola — quando ci sarà abbastanza da raccontare.