Mistral 7B: l'Europa entra nella partita dei modelli
· 4 min di lettura
Scritto con l'intelligenza artificiale
Il 27 settembre la parigina Mistral AI ha rilasciato Mistral 7B con licenza Apache 2.0. Che cosa cambia quando un modello piccolo e aperto può girare dentro l'azienda, e come progettare i prompt per usarlo bene.
Il 27 settembre una startup di Parigi ha pubblicato il suo primo modello linguistico e lo ha messo a disposizione di tutti, con un link per scaricarlo e una licenza che non pone limiti d'uso. Si chiama Mistral 7B e, a una settimana di distanza, è già uno dei nomi più discussi tra chi lavora con l'AI generativa. Per l'Europa è una notizia importante, e non solo per l'Europa.
Chi è Mistral AI
Mistral AI è nata a Parigi nella primavera di quest'anno. A giugno, con appena quattro settimane di vita, ha raccolto un finanziamento seed di 105 milioni di euro guidato da Lightspeed Venture Partners, come ha raccontato TechCrunch. I fondatori, Arthur Mensch, Timothée Lacroix e Guillaume Lample, vengono da Google DeepMind e da Meta: conoscono bene il mestiere di costruire modelli linguistici di grandi dimensioni.
Finora la scena era dominata da aziende americane: OpenAI, Anthropic, Google, Meta. Con Mistral 7B un'azienda europea entra nella partita con un prodotto concreto.
Che cosa ha di speciale Mistral 7B
Il numero nel nome indica la taglia: 7,3 miliardi di parametri, pochi rispetto ai giganti del settore. Secondo i test pubblicati dall'azienda, però, il modello supera Llama 2 13B, che ha quasi il doppio dei parametri, su tutti i benchmark considerati, e sul codice si avvicina a CodeLlama 7B.
La vera novità è la licenza. Mistral 7B è rilasciato con licenza Apache 2.0 e si può usare senza restrizioni, anche a fini commerciali. Si può scaricare (perfino via torrent), eseguire in locale, installare sul cloud che si preferisce o provare su Hugging Face. L'azienda ha pubblicato anche una versione addestrata per la conversazione.
Una precisazione è utile. Come ha osservato TechCrunch, un modello che tutti possono scaricare e usare non è la stessa cosa di un progetto «open source» in senso pieno: Mistral ha reso disponibili i pesi del modello, cioè il risultato dell'addestramento, ma non i dati e il procedimento con cui è stato costruito, che il CEO Arthur Mensch ha definito proprietari «per ora». Per questo, accanto a «open source», si sente sempre più spesso l'espressione «open weight», a pesi aperti.
Che cosa cambia per chi lavora con i prompt
Con ChatGPT o Claude il modello vive sui server di qualcun altro: si scrive un prompt, lo si invia e si riceve una risposta. Un modello come Mistral 7B, invece, può girare dentro l'azienda, su un server proprio. Questo apre tre possibilità concrete.
- Dati che restano in casa. Documenti riservati, contratti, dati dei clienti si possono elaborare senza uscire dall'infrastruttura aziendale.
- Costi prevedibili. Per compiti ripetitivi e ad alto volume (classificare email, estrarre campi da moduli, riassumere segnalazioni) un modello piccolo installato in proprio può costare meno di un servizio a consumo.
- Specializzazione. Mistral 7B si può addestrare ulteriormente su un compito preciso, come dimostra la versione per la chat pubblicata dall'azienda.
C'è però un prezzo da pagare: un modello da 7 miliardi di parametri non è GPT-4. Conosce meno fatti (la stessa Mistral ammette che sui test di conoscenza è solo alla pari con Llama 2 13B), ed è prudente non aspettarsi da un modello piccolo la stessa tolleranza per le istruzioni vaghe. Conviene quindi progettare i prompt in modo diverso: più brevi, più espliciti, con un formato di uscita chiaro e qualche esempio che mostri cosa ci si aspetta.
Un esempio pratico
Immaginiamo un servizio clienti che riceve centinaia di email al giorno. Invece di chiedere al modello «leggi e dimmi cosa vuole il cliente», un Prompt Architect scompone il compito e affida al modello piccolo solo il pezzo che sa fare bene:
Classifica l'email qui sotto in una sola di queste categorie: ORDINE, RECLAMO, FATTURA, ALTRO. Rispondi solo con la categoria, in maiuscolo, senza altre parole.
Esempio: «Non mi è arrivata la fattura di settembre» → FATTURA
Email: {testo}
La classificazione gira in locale, veloce ed economica. Solo i casi più delicati, come i reclami che richiedono una risposta articolata, passano a un modello più grande.
Il consiglio operativo
Non chiedetevi quale sia il modello migliore in assoluto, ma quale sia il modello giusto per ogni passaggio del vostro flusso. Fate una mappa dei compiti che oggi affidate all'AI e segnate quelli semplici, ripetitivi e delicati per la riservatezza dei dati: sono i primi candidati per un modello piccolo e aperto come Mistral 7B. Poi preparate un piccolo insieme di prove, venti o trenta casi reali con la risposta attesa, e confrontate i risultati prima di cambiare strumento.
L'arrivo di Mistral dimostra che l'AI generativa non sarà per forza un affare di pochi fornitori americani. Per chi progetta sistemi è una buona notizia: più modelli significa più scelte, a patto di saperle fare con metodo.
Fonti
- TechCrunch, France's Mistral AI blows in with a $113M seed round at a $260M valuation to take on OpenAI, 13 giugno 2023
- Mistral AI, Mistral 7B, 27 settembre 2023
- TechCrunch, Mistral AI makes its first large language model free for everyone, 27 settembre 2023