Diario da Maquina de LLM
Diário da Máquina de LLM
Esta é a série carro-chefe do blog. A premissa: quase ninguém publica a operação real de um LLM próprio com número. O que existe é benchmark de fabricante, tutorial de instalação e vídeo de demo. O que não existe é o log real do dia 1, com o hardware específico, o modelo escolhido, o que a máquina fez, quanto custou por 1k tokens comparado à API e o que quebrou primeiro.
A empresa já tem custo real de API e infraestrutura de agents operacional. O próximo passo é colocar um modelo na nossa própria máquina, medir e comparar com a API paga. Cada etapa desse processo vira uma entrada do diário. Cada entrada exige um número medido: sem número não há entrada, sem entrada não há post.
Entrada 0 | em preparação
| Campo | Status |
|---|---|
| Data | a preencher |
| Máquina (CPU, GPU, VRAM, RAM, disco, onde está) | a preencher |
| Objetivo (o que a máquina vai responder, qual rota de LLM substitui) | a preencher |
| Modelos candidatos e quantização | a preencher |
| Runtime (vllm, llama.cpp, ollama, outro) | a preencher |
| Primeiro número medido (tokens/s, latência p50, custo por 1k tokens vs API) | a preencher |
| O que deu errado no primeiro dia | a preencher |
Igor preenche ou dita no chat. A série começa quando a Entrada 0 tiver todos os campos preenchidos com número real.
Entradas seguintes
Cada entrada depois da Entrada 0 usa o seguinte formato. A decisão registrada é sempre concreta: manter o modelo, trocar, ajustar quantização ou abandonar. Não há consenso de comunidade aqui, há número e contexto de produção real.
| Data | O que testamos | Número | O que quebrou | Decisão |
|---|---|---|---|---|
| Entradas a publicar conforme o diário for preenchido | ||||