Interpretabilidad mecanicista con TransformerLens

En un post pasado vimos una introducción a la interpretabilidad mecanicista y como intenta extraer información de los pesos y activaciones de los LLMs. Una de las librerías más usadas en interpretabilidad mecanicista es TransformerLens, que permite cargar un LLM open source y explorar y transformar las activaciones del modelo. Vamos a ver un ejemplo... Seguir leyendo →

Uso de autoencoders (SAE) para interpretabilidad mecanicista

En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →

Captum. Librería para interpretabilidad en PyTorch

Esta entrada es parte del curso de Deep learning con PyTorch. Captum es una librería de PyTorch para proporcionar interpretabilidad a los modelos de deep learning. Con la complejidad de los actuales modelos de deep learning, la interpretabilidad y explicabilidad de los modelos es clave. Los algoritmos de interpretabilidad de Captum se separan en tres... Seguir leyendo →

Orgullosamente ofrecido por WordPress | Tema: Baskerville 2 por Anders Noren.

Subir ↑