⚡ Tecnología
Por qué tu LLM local se siente más tonto de lo que es
Introducción: el misterio del LLM lento
Has notado que tu modelo local parece responder más lento de lo habitual? No estás solo. Muchos desarrolladores han reportado este fenómeno después de ciertas actualizaciones o cambios de configuración.
Causas comunes
- Quantización agresiva que reduce la precisión percebida
- Contexto de ventana creciente que ralentiza la inferencia
- Cambios en las capas intermedias después de actualizaciones
- Limitaciones de hardware que no son obvias
Soluciones prácticas
Intenta estos enfoques para recuperar el rendimiento:
- Reducir el tamaño del contexto a 2048 tokens
- Actualizar los controladores de tu GPU
- Usar un modelo cuantizado menos agresivamente
- Verificar que no haya procesos en segundo plano compitiendo por recursos
Si el problema persiste, podría ser hora de considerar un modelo diferente o ajustar tus expectativas sobre lo que un hardware de consumo puede lograr de manera confiable.