En un post pasado vimos los recursos de memoria para los LLMs en producción o inferencia y que la KV cache, que almacena temporalmente los vectores Clave (Key) y Valor (Value) generados durante la lectura de la secuencia, es junto con el almacenamiento del modelo, uno de los mayores consumidores de RAM en inferencia. Para... Seguir leyendo →
