En un post pasado vimos una introducción a la interpretabilidad mecanicista y como intenta extraer información de los pesos y activaciones de los LLMs. Una de las librerías más usadas en interpretabilidad mecanicista es TransformerLens, que permite cargar un LLM open source y explorar y transformar las activaciones del modelo. Vamos a ver un ejemplo... Seguir leyendo →
Optimización de la KV cache en LLMs
En un post pasado vimos los recursos de memoria para los LLMs en producción o inferencia y que la KV cache, que almacena temporalmente los vectores Clave (Key) y Valor (Value) generados durante la lectura de la secuencia, es junto con el almacenamiento del modelo, uno de los mayores consumidores de RAM en inferencia. Para... Seguir leyendo →
El Transpiler de Qiskit y las restricciones de los procesadores cuánticos
El transpiler de Qiskit es el motor de compilación que transforma un circuito cuántico abstracto en uno que pueda ejecutarse físicamente en un procesador cuántico real. Un circuito abstracto puede usar cualquier puerta lógica: Hadamard, Toffoli, SWAP, rotaciones arbitrarias... pero los procesadores reales solo entienden un pequeño conjunto de puertas nativas. El transpiler se encarga... Seguir leyendo →
Uso de autoencoders (SAE) para interpretabilidad mecanicista
En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →
Introducción a la interpretabilidad mecanicista de los LLMs
La interpretabilidad mecanicista tiene como objetivo aplicar ingeniería inversa a los pesos y activaciones aprendidos en los modelos de lenguaje de gran tamaño (LLMs) y modelos basados en redes neuronales para convertirlos en algoritmos comprensibles para los seres humanos. En lugar de tratar los modelos como cajas negras o depender de atribuciones de características de... Seguir leyendo →
Corrección de errores cuánticos con estabilizadores
La corrección de errores cuánticos es un aspecto crucial en el escalado de ordenadores cuánticos para poder aprovechar la ventaja cuántica y desarrollar algoritmos de manera fiable. Los principales tipos de errores son el error de inversión de bit, que altera el estado de un qubit de $latex |0\rangle$ a $latex |1\rangle$ (y viceversa), el... Seguir leyendo →
LoRA para adaptación eficiente
LoRA (Low-Rank Adaptation) es una técnica ideada en 2021 por un equipo de investigadores de Microsoft que reduce drásticamente el número de parámetros entrenables en modelos de lenguaje de gran tamaño. En el ajuste fino tradicional, el modelo ajusta una matriz de pesos para obtener la matriz adaptada. LoRA congela el modelo base y calcula... Seguir leyendo →
Recursos (memoria) para LLMs en producción
Debido al auge que han tenido los LLMs (grandes modelos de lenguaje), que consumen grandes recursos (procesador, memoria, almacenamiento) durante su entrenamiento, es también importante estimar el consumo de recursos cuando desplegamos esos modelos en producción. De hecho, la escalada de precios actual de la memoria RAM, HBM (Memoria de Alto Ancho de Banda) y... Seguir leyendo →
QFT (transformada cuántica de Fourier) para encontrar el período de una función
La transformada cuántica de Fourier (QFT) es un elemento clave en los algoritmos cuánticos, especialmente en el algoritmo de estimación de fase y en el algoritmo de Shor. Vamos a ver como la transformada inversa de Fourier (IQFT) permite encontrar el período de una función periódica que se implementa aplicando fases periódicas. Recordemos que una... Seguir leyendo →
Simuladores de circuitos cuánticos online
Los simuladores de circuitos cuánticos en la Web son herramientas visuales e intuitivas que permiten explorar, aprender y entender el comportamiento de circuitos cuánticos pequeños. Para ello, solo tenemos que arrastrar y soltar los elementos del circuito y visualizar su comportamiento. Una de los más conocidos es Quirk, una herramienta web de código abierto y... Seguir leyendo →
