Interpretabilidad mecanicista con TransformerLens

En un post pasado vimos una introducción a la interpretabilidad mecanicista y como intenta extraer información de los pesos y activaciones de los LLMs. Una de las librerías más usadas en interpretabilidad mecanicista es TransformerLens, que permite cargar un LLM open source y explorar y transformar las activaciones del modelo. Vamos a ver un ejemplo... Seguir leyendo →

Optimización de la KV cache en LLMs

En un post pasado vimos los recursos de memoria para los LLMs en producción o inferencia y que la KV cache, que almacena temporalmente los vectores Clave (Key) y Valor (Value) generados durante la lectura de la secuencia, es junto con el almacenamiento del modelo, uno de los mayores consumidores de RAM en inferencia. Para... Seguir leyendo →

El Transpiler de Qiskit y las restricciones de los procesadores cuánticos

El transpiler de Qiskit es el motor de compilación que transforma un circuito cuántico abstracto en uno que pueda ejecutarse físicamente en un procesador cuántico real. Un circuito abstracto puede usar cualquier puerta lógica: Hadamard, Toffoli, SWAP, rotaciones arbitrarias... pero los procesadores reales solo entienden un pequeño conjunto de puertas nativas. El transpiler se encarga... Seguir leyendo →

Uso de autoencoders (SAE) para interpretabilidad mecanicista

En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →

Corrección de errores cuánticos con estabilizadores

La corrección de errores cuánticos es un aspecto crucial en el escalado de ordenadores cuánticos para poder aprovechar la ventaja cuántica y desarrollar algoritmos de manera fiable. Los principales tipos de errores son el error de inversión de bit, que altera el estado de un qubit de $latex |0\rangle$ a $latex |1\rangle$ (y viceversa), el... Seguir leyendo →

LoRA para adaptación eficiente

LoRA (Low-Rank Adaptation) es una técnica ideada en 2021 por un equipo de investigadores de Microsoft que reduce drásticamente el número de parámetros entrenables en modelos de lenguaje de gran tamaño. En el ajuste fino tradicional, el modelo ajusta una matriz de pesos para obtener la matriz adaptada. LoRA congela el modelo base y calcula... Seguir leyendo →

Recursos (memoria) para LLMs en producción

Debido al auge que han tenido los LLMs (grandes modelos de lenguaje), que consumen grandes recursos (procesador, memoria, almacenamiento) durante su entrenamiento, es también importante estimar el consumo de recursos cuando desplegamos esos modelos en producción. De hecho, la escalada de precios actual de la memoria RAM, HBM (Memoria de Alto Ancho de Banda) y... Seguir leyendo →

Simuladores de circuitos cuánticos online

Los simuladores de circuitos cuánticos en la Web son herramientas visuales e intuitivas que permiten explorar, aprender y entender el comportamiento de circuitos cuánticos pequeños. Para ello, solo tenemos que arrastrar y soltar los elementos del circuito y visualizar su comportamiento. Una de los más conocidos es Quirk, una herramienta web de código abierto y... Seguir leyendo →

Orgullosamente ofrecido por WordPress | Tema: Baskerville 2 por Anders Noren.

Subir ↑