7 formas de reducir el consumo de RAM que tu LLM local no te dice

Configuraciones de optimizacion de LLM local
Optimización de LLM local

¿Tu LLM local se siente lento? El consumo excesivo de RAM es el problema número uno cuando ejecutas modelos de lenguaje en tu propia máquina. Aquí tienes 7 configuraciones probadas que pueden reducir hasta un 40% del uso de memoria:

  1. Quantización 4-bit: Usar GGUF o bitsandbytes para reducir el modelo a 4 bits. Esto reduce la RAM en un 50% o más con un ligero descenso en calidad que a menudo pasa desapercibido para el usuario.
  2. Contexto deslizante: En lugar de mantener todo el historial de conversación en memoria, usa un contexto de solo las últimas N mensajes. La mayoría de los usuarios rara vez necesitan más de 3-4 intercambios previos.
  3. Desactivar embeddings de capa: Muchas librerías añaden embeddings adicionales que no contribuyen a la generación principal. Desactivarlos puede ahorrar cientos de MB.
  4. Cacheo de capa de atención: Habilitar el cacheo de las capas de atención evita cálculos redundantes cuando el mismo prompt se ejecuta múltiples veces.
  5. Reducir temperatura a 0.7: temperaturas más bajas no solo hacen la salida más determinística, sino que reducen la carga de trabajo en la memoria de trabajo del modelo.
  6. Usar arquitecturas Mixture-of-Experts (MoE) solo cuando sea necesario: Los modelos MoE activan solo una fracción de parámetros por token, pero si no necesitas la capacidad extra, los modelos estándar son más eficientes.
  7. Limpiar capas de kv-cache: El cache de clave-valor crece linealmentre con cada token generado. Reiniciarlo periódicamente evita fugas de memoria.

Bonus: Hardware recomendado

Si vas a ejecutar LLMs localmente, considera al menos 16GB de RAM para modelos pequeños (7B) y 32GB+ para modelos medianos (13B-30B). El intercambio de memoria en disco (offloading) puede ayudar, pero reduce significativamente la velocidad de generación.

¿Qué técnica ya estás usando? Comenta al final y ayudemos a la comunidad latinx a optimizar sus setups.