Uso de autoencoders (SAE) para interpretabilidad mecanicista

En un post pasado vimos una introducción a la interpretabilidad mecanicista. Vimos que una sola neurona de un modelo de lenguaje (LLM) se activa ante conceptos completamente diferentes y que los SAEs (Sparse Autoencoders) descomponen estas activaciones complejas en características o conceptos (features) dispersos y monosemánticos (que significan una sola cosa). También referenciamos tutoriales de... Seguir leyendo →

LoRA para adaptación eficiente

LoRA (Low-Rank Adaptation) es una técnica ideada en 2021 por un equipo de investigadores de Microsoft que reduce drásticamente el número de parámetros entrenables en modelos de lenguaje de gran tamaño. En el ajuste fino tradicional, el modelo ajusta una matriz de pesos para obtener la matriz adaptada. LoRA congela el modelo base y calcula... Seguir leyendo →

Recursos (memoria) para LLMs en producción

Debido al auge que han tenido los LLMs (grandes modelos de lenguaje), que consumen grandes recursos (procesador, memoria, almacenamiento) durante su entrenamiento, es también importante estimar el consumo de recursos cuando desplegamos esos modelos en producción. De hecho, la escalada de precios actual de la memoria RAM, HBM (Memoria de Alto Ancho de Banda) y... Seguir leyendo →

Regresión simbólica con GPlearn

La regresión simbólica es un modelo de machine learning que busca en el espacio de posibles expresiones matemáticas la expresión que mejor se ajusta a los datos. Al contrario que otras técnicas de regresión, como la regresión lineal, no se especifica una estructura previa del modelo a optimizar sino que va construyendo expresiones matemáticas aleatoriamente.... Seguir leyendo →

¿Una burbuja en la IA generativa?

En los últimos meses hemos visto mucha discusión sobre si la IA generativa es una burbuja económica o no. Ahora parece que todas las startups tienen algún componente de IA generativa. Recientemente, Financial Times nos dio su visión escéptica. Bank of America primero dijo que era una burbuja y luego se desdijo. Goldman Sachs a... Seguir leyendo →

Creando nuevas funciones en PyTorch

En este post de nuestro tutorial de deep learning con PyToch vamos a ver como extender PyTorch. Si quieremos implementar un nuevo módulo o función no disponible en las librerías de PyTorch tenemos varias opciones dependiendo del caso: Si queremos añadir primitivas clásicas (if, while,...) en un módulo, simplemente insertaremos las primitivas en el método... Seguir leyendo →

Orgullosamente ofrecido por WordPress | Tema: Baskerville 2 por Anders Noren.

Subir ↑