Interpretability
Understanding how a model works internally, as opposed to just describing its outputs.
L’interprétabilité pose la question mécaniste : que calculent réellement ces poids et ces activations ? C’est plus difficile que l’explicabilité et plus précieux, car cela peut révéler des modes de défaillance avant qu’ils n’apparaissent dans les sorties. Les progrès sont réels mais très en retard sur les capacités.
En pratique : Identifier les caractéristiques internes qu’un modèle utilise pour représenter un concept.