Trust, Risk & Safety advanced

Interpretability

Understanding how a model works internally, as opposed to just describing its outputs.

La interpretabilidad es la pregunta mecanicista: ¿qué están calculando en realidad estos pesos y activaciones? Es más difícil que la explicabilidad y más valiosa, porque puede revelar modos de fallo antes de que aparezcan en las salidas. El progreso es real, pero va muy por detrás de la capacidad.

En la práctica: Identificar las características internas que un modelo usa para representar un concepto.