Interpretability
Understanding how a model works internally, as opposed to just describing its outputs.
A interpretabilidade é a pergunta mecanicista: o que esses pesos e ativações estão de fato computando? É mais difícil que a explicabilidade e mais valiosa, porque pode revelar modos de falha antes que eles apareçam nas saídas. O avanço é real, mas está muito atrás da capacidade dos modelos.
Na prática: Identificar as features internas que um modelo usa para representar um conceito.