En un post pasado vimos una introducción a la interpretabilidad mecanicista y como intenta extraer información de los pesos y activaciones de los LLMs. Una de las librerías más usadas en interpretabilidad mecanicista es TransformerLens, que permite cargar un LLM open source y explorar y transformar las activaciones del modelo. Vamos a ver un ejemplo... Seguir leyendo →
Optimización de la KV cache en LLMs
En un post pasado vimos los recursos de memoria para los LLMs en producción o inferencia y que la KV cache, que almacena temporalmente los vectores Clave (Key) y Valor (Value) generados durante la lectura de la secuencia, es junto con el almacenamiento del modelo, uno de los mayores consumidores de RAM en inferencia. Para... Seguir leyendo →
Uso de autoencoders (SAE) para interpretabilidad mecanicista
En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →
Introducción a la interpretabilidad mecanicista de los LLMs
La interpretabilidad mecanicista tiene como objetivo aplicar ingeniería inversa a los pesos y activaciones aprendidos en los modelos de lenguaje de gran tamaño (LLMs) y modelos basados en redes neuronales para convertirlos en algoritmos comprensibles para los seres humanos. En lugar de tratar los modelos como cajas negras o depender de atribuciones de características de... Seguir leyendo →
LoRA para adaptación eficiente
LoRA (Low-Rank Adaptation) es una técnica ideada en 2021 por un equipo de investigadores de Microsoft que reduce drásticamente el número de parámetros entrenables en modelos de lenguaje de gran tamaño. En el ajuste fino tradicional, el modelo ajusta una matriz de pesos para obtener la matriz adaptada. LoRA congela el modelo base y calcula... Seguir leyendo →
Recursos (memoria) para LLMs en producción
Debido al auge que han tenido los LLMs (grandes modelos de lenguaje), que consumen grandes recursos (procesador, memoria, almacenamiento) durante su entrenamiento, es también importante estimar el consumo de recursos cuando desplegamos esos modelos en producción. De hecho, la escalada de precios actual de la memoria RAM, HBM (Memoria de Alto Ancho de Banda) y... Seguir leyendo →
Estado de negocio de la Inteligencia Artificial. ¿Hay burbuja?
La tendencia creciente de la población a usar modelos generales y la tendencia de las empresas a realizar aplicaciones específicas servirán de soporte a la inversión en infraestructura de IA. Habrá problemas en empresas puras de IA con poca rentabilidad y mucha competencia Este informe contiene el estado actual de negocio de la IA, cómo... Seguir leyendo →
Regresión simbólica con GPlearn
La regresión simbólica es un modelo de machine learning que busca en el espacio de posibles expresiones matemáticas la expresión que mejor se ajusta a los datos. Al contrario que otras técnicas de regresión, como la regresión lineal, no se especifica una estructura previa del modelo a optimizar sino que va construyendo expresiones matemáticas aleatoriamente.... Seguir leyendo →
Riesgo de las startups dependientes de modelos generativos de terceros
En un post pasado describimos la cadena de valor de los modelos generativos como ChatGPT y en otro analizamos si hay una burbuja en la inteligencia artificial (IA) generativa debido a la gran cantidad de startups que están surgiendo. En dichos posts identificamos las siguientes partes de la cadena de valor de los modelos generativos:... Seguir leyendo →
¿Una burbuja en la IA generativa?
En los últimos meses hemos visto mucha discusión sobre si la IA generativa es una burbuja económica o no. Ahora parece que todas las startups tienen algún componente de IA generativa. Recientemente, Financial Times nos dio su visión escéptica. Bank of America primero dijo que era una burbuja y luego se desdijo. Goldman Sachs a... Seguir leyendo →
