Messen statt raten: Das passende LLM systematisch auswählen
Welches Sprachmodell passt zur eigenen Anwendung? Öffentliche Benchmarks und Modellkarten geben Orientierung, ersetzen aber keine Tests anhand der eigenen Anforderungen und Daten. Gleichzeitig entwickeln sich Modelle, Quantisierungsverfahren, Serving-Stacks und kommerzielle Angebote so schnell, dass punktuelle Vergleiche rasch veralten.
Der Vortrag zeigt, wie Unternehmen unterschiedliche LLM-Kandidaten strukturiert und möglichst automatisiert evaluieren können. Im Mittelpunkt stehen aussagekräftige Testfälle, fachliche und technische Bewertungskriterien, reproduzierbare Abläufe sowie eine nachvollziehbare Auswertung. Je nach Szenario lassen sich lokal betriebene Modelle, gemietete Infrastruktur und LLM-Dienste einbeziehen.
Das Ziel ist keine allgemeingültige Rangliste und keine konkrete Hardwareempfehlung. Stattdessen entsteht ein wiederholbarer Entscheidungsprozess, mit dem sich neue Modelle und Technologien laufend bewerten lassen: Wie viel Modell ist für den eigenen Anwendungsfall wirklich nötig und wann ist kleiner, schneller oder günstiger die bessere Wahl?