Pular para o conteúdo

Diario da Maquina de LLM

Diário da Máquina de LLM

Esta é a série carro-chefe do blog. A premissa: quase ninguém publica a operação real de um LLM próprio com número. O que existe é benchmark de fabricante, tutorial de instalação e vídeo de demo. O que não existe é o log real do dia 1, com o hardware específico, o modelo escolhido, o que a máquina fez, quanto custou por 1k tokens comparado à API e o que quebrou primeiro.

A empresa já tem custo real de API e infraestrutura de agents operacional. O próximo passo é colocar um modelo na nossa própria máquina, medir e comparar com a API paga. Cada etapa desse processo vira uma entrada do diário. Cada entrada exige um número medido: sem número não há entrada, sem entrada não há post.

Entrada 0 | em preparação

Campo Status
Data a preencher
Máquina (CPU, GPU, VRAM, RAM, disco, onde está) a preencher
Objetivo (o que a máquina vai responder, qual rota de LLM substitui) a preencher
Modelos candidatos e quantização a preencher
Runtime (vllm, llama.cpp, ollama, outro) a preencher
Primeiro número medido (tokens/s, latência p50, custo por 1k tokens vs API) a preencher
O que deu errado no primeiro dia a preencher

Igor preenche ou dita no chat. A série começa quando a Entrada 0 tiver todos os campos preenchidos com número real.

Entradas seguintes

Cada entrada depois da Entrada 0 usa o seguinte formato. A decisão registrada é sempre concreta: manter o modelo, trocar, ajustar quantização ou abandonar. Não há consenso de comunidade aqui, há número e contexto de produção real.

Data O que testamos Número O que quebrou Decisão
Entradas a publicar conforme o diário for preenchido
error: