1 Gen 2026·Studio Futuro Lab·Research

Benchmark LLM su italiano tecnico enterprise

Costruzione di un dataset di 240 prompt tecnici in italiano — domini fiscale, logistico, normativo — e valutazione su 6 modelli. La classe Claude Sonnet e GPT-4 guida la classifica; i modelli open-source mostrano difficoltà su terminologia tecnica e sfumature legali.

Takeaway

Per l'italiano tecnico enterprise, il divario open vs closed resta rilevante. Su progetti sensibili, un LLM commerciale con DPA chiaro supera in affidabilità un self-hosting immaturo.

Un incontro

Parliamo del tuo progetto

Ci dici cosa stai facendo, dove sei bloccato e cosa deve funzionare. Se ha senso, definiamo un primo pezzo concreto.

hello@studiofuturo.ai

Risposta entro 24 ore lavorative