La interpretabilidad mecanicista tiene como objetivo aplicar ingeniería inversa a los pesos y activaciones aprendidos en los modelos de lenguaje de gran tamaño (LLMs) y modelos basados en redes neuronales para convertirlos en algoritmos comprensibles para los seres humanos. En lugar de tratar los modelos como cajas negras o depender de atribuciones de características de bajo nivel de detalle, este paradigma aborda las redes como sistemas computacionales. El objetivo fundamental es vincular las representaciones internas con conceptos semánticos explícitos y rastrear el flujo de información a través de la red para generar resultados específicos. Hay buenos tutoriales de introducción, recursos y librerías como TransformerLens.
El dominio se basa en un conjunto de hipótesis fundamentales sobre cómo las redes neuronales organizan y procesan la información:
1. Representaciones lineales: Los conceptos (features) se codifican como direcciones en el espacio vectorial de las activaciones neuronales. Si denota la activación en la capa
y el token
.
donde son los conceptos (features),
son coeficientes de activación (con muchos valores nulos),
es el número de potenciales conceptos y
es ruido.
Normalmente, se usan Unsupervised Sparse Autoencoder (SAE) entrenados en las activaciones internas para reconstruirlas como una combinación lineal de los conceptos.
2. Superposición: Dado que el número de conceptos m supera ampliamente la dimensionalidad d, el modelo comprime múltiples conceptos en el mismo subespacio. Esto es posible porque, en espacios de alta dimensionalidad, coexisten muchas direcciones casi ortogonales. Así, los conceptos se solapan, generando polisemia: neuronas individuales responden a múltiples conceptos no relacionados.
3. Circuitos: El modelo se descompone en circuitos —subgrafos mínimos e interpretables de componentes (cabezales de atención, neuronas MLP) que implementan causalmente subalgoritmos coherentes. Un circuito G = (V, E) satisface:
- V es un conjunto de componentes del modelo (pe. una cabeza de atención).
- E codifica las dependencias causales, verificadas mediante intervención.
- El circuito calcula una función identificable:
.
- La ablación de G perjudica significativamente el rendimiento en la tarea.
4. Universalidad: Ciertos circuitos y patrones computacionales son universales, independientemente de la escala o la arquitectura del modelo:
- Los patrones de inducción aparecen de manera consistente como mecanismos de aprendizaje en contexto.
- Surgen cabezales (heads) de copia y recuperación en diversos entornos.
- La geometría de los conceptos (superposición lineal, ortogonalidad) parece ser independiente de la tarea y de la escala.
- Los circuitos que implementan funciones similares presentan estructuras de pesos y patrones de activación semejantes.

Para validar estas hipótesis, se utilizan diversas técnicas, además de los autoencoders (SAE) comentados:
- Intervención en activaciones: También conocida como intervención de intercambio causal. Consiste en sustituir activaciones internas específicas durante una pasada hacia adelante (forward pass) con un prompt A por activaciones provenientes de un prompt B contrafáctico. Esto permite medir la huella causal exacta de dichos componentes específicos en el resultado final.
- Causal Scrubbing (Evaluación): Una generalización sistemática de la intervención. Consiste en eliminar o aleatorizar de forma recursiva aquellas activaciones que se hipotetiza son irrelevantes para un circuito específico, verificando el impacto en la función estudiada del modelo.
- Logit Lens y Tuned Lens: Métodos que omiten las capas restantes y aplican directamente la normalización de la capa final y la matriz de desincrustación (unembedding matrix) a las activaciones intermedias. Esto proyecta los estados ocultos directamente en el espacio del vocabulario para extraer el «itinerario» o las predicciones intermedias del modelo.
Como vemos, la interpretabilidad mecanicista suena teóricamente muy bien, es un enfoque reduccionista y nos recuerda a las neurociencias computacionales, que buscan entender el comportamiento del cerebro a través del análisis de las neuronas, conexiones y circuitos neuronales. Sin embargo, de un análisis preliminar de las hipótesis, se observan varios aspectos:
- Las hipótesis parecen derivadas de un intento de asociar las operaciones tensoriales de un modelo a conceptos interpretables por los humanos.
- Sabemos que arquitecturas diferentes de redes neuronales (redes multicapa, redes recurrentes, convolucionales, etc.) son capaces de realizar las mismas funciones. Esto nos indica que las neuronas y sus conexiones se adaptan para desarrollar una función y no que sean las neuronas y circuitos los que determinan la función.
- La gran aportación del marco general de las redes neuronales, la programación diferenciable, es que los datos determinan el programa a través de un proceso de optimización (aprendizaje). Esto ha permitido grandes avances en el uso de modelos para multitud de tareas y el desarrollo de los LLMs. Si estas tareas se pudieran explicar a través de una serie de reglas interpretables para los humanos, ya se hubieran desarrollado programando esas reglas antes de la aparición del deep learning y la programación diferenciable.
Sin duda, la interpretabilidad mecanicista es un campo interesante que va a aportar mucho a la comprensión de los LLMs y va a generar debate en cuento al nivel de detalle y el enfoque (reduccionista frente a holístico) necesario para entender los sistemas complejos y los modelos de inteligencia artificial.

Deja una respuesta
Lo siento, debes estar conectado para publicar un comentario.