Uso de autoencoders (SAE) para interpretabilidad mecanicista

En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →

Captum. Librería para interpretabilidad en PyTorch

Esta entrada es parte del curso de Deep learning con PyTorch. Captum es una librería de PyTorch para proporcionar interpretabilidad a los modelos de deep learning. Con la complejidad de los actuales modelos de deep learning, la interpretabilidad y explicabilidad de los modelos es clave. Los algoritmos de interpretabilidad de Captum se separan en tres... Seguir leyendo →

Orgullosamente ofrecido por WordPress | Tema: Baskerville 2 por Anders Noren.

Subir ↑