Interpretability
Understanding how a model works internally, as opposed to just describing its outputs.
Interpretierbarkeit ist die mechanistische Frage: Was berechnen diese Gewichte und Aktivierungen eigentlich? Sie ist schwerer als Erklärbarkeit und wertvoller, weil sie Fehlermodi aufdecken kann, bevor sie in den Ausgaben auftauchen. Die Fortschritte sind real, hinken der Leistungsfähigkeit aber weit hinterher.
In der Praxis: Die internen Features identifizieren, mit denen ein Modell ein Konzept repräsentiert.