1 Gen 2026·Studio Futuro Lab·Research
Benchmark LLM su italiano tecnico enterprise
Costruzione di un dataset di 240 prompt tecnici in italiano — domini fiscale, logistico, normativo — e valutazione su 6 modelli. La classe Claude Sonnet e GPT-4 guida la classifica; i modelli open-source mostrano difficoltà su terminologia tecnica e sfumature legali.
Takeaway
Per l'italiano tecnico enterprise, il divario open vs closed resta rilevante. Su progetti sensibili, un LLM commerciale con DPA chiaro supera in affidabilità un self-hosting immaturo.
