Diario de la Máquina de LLM
Esta es la serie insignia del blog. La premisa: casi nadie publica la operación real de un LLM propio con números. Lo que existe son benchmarks de fabricantes, tutoriales de instalación y videos de demostración. Lo que no existe es el registro real del día 1, con el hardware específico, el modelo elegido, lo que hizo la máquina, cuánto costó por 1k tokens en comparación con la API y qué fue lo primero que falló.
La empresa ya tiene un costo real de API y una infraestructura de agentes operativa. El siguiente paso es instalar un modelo en nuestra propia máquina, medir y comparar con la API de pago. Cada etapa de este proceso se convierte en una entrada del diario. Cada entrada exige un número medido: sin número no hay entrada, sin entrada no hay post.
Entradas publicadas
-
Mil páginas reales: lo que Portal Patas me enseñó sobre el SEO programático local con inventario vivo
Cómo 1.693 clics distribuidos en más de mil páginas revelaron la diferencia entre SEO programático local que convierte y el que solo genera impresiones. Estudio de caso con datos reales…
-
llama-server HTTP 500 context size has been exceeded: buffer KV compartido y cómo resolverlo | Igor Caique
llama-server devolvió un HTTP 500 context size has been exceeded en las tres llamadas simultáneas. Búfer KV compartido, causa raíz y tres configuraciones probadas.
-
llama.cpp KV cache VRAM con Devstral 16 GB: de 0,33 a 19,3 tok/s | Igor Caique
llama.cpp con Devstral en GPU de 16 GB de VRAM: de 0,33 tok/s a 19,3 tok/s ajustando el KV cache. El cálculo, el diagnóstico y la config de producción.
-
268 clics en 90 días: lo que el pSEO de servicio local hizo por BrothersBBK
Caso real: 7.032 impresiones y 268 clics en 90 días para un negocio de asados con pSEO de servicio local. Consultas, resultados y la lección principal.
-
522 páginas, 13 clics: por qué las páginas delgadas de SEO no rankean
Un panel nuestro acumuló 522 páginas y 13 clics en 16 meses. Entienda por qué las páginas de bajo contenido no posicionan y lo que medimos antes de corregir.
-
El parche que logueaba “patched” y nunca se ejecutó | 737 MB por minuto hasta el OOM
Cómo la BFCArena de ONNX Runtime creció silenciosamente hasta 737 MB/min y por qué el primer parche era un placebo. Causa raíz, la solución en un número.