BenchLLM
Testa modelos GGUF em várias configurações e mostra num painel web qual roda melhor na minha placa.
01 Problema
Rodar um modelo GGUF localmente tem um monte de botão para girar: quantização, tamanho de contexto, parâmetros do llama.cpp. Acertar a combinação na mão é tentativa e erro, e toma tempo.
02 Meu papel
Projeto meu do começo ao fim: a ideia, o desenvolvimento (com o Claude Code) e os testes na RTX 5080.
03 Processo
Fui construindo com o Claude Code: uma parte roda os benchmarks com o llama.cpp e guarda os resultados, e um painel web mostra as comparações.
04 Resultado
Está na reta final. Quando fechar, coloco os números aqui.