FAQ & resolução de problemas¶
Preciso de internet?¶
Não. O ollabench fala com o teu servidor Ollama local; puxa os modelos primeiro
(ollama pull llama3.2) e tudo corre offline.
Um modelo mostra ⚠️ / 0 passados¶
Esse modelo deu erro no caso — normalmente não está puxado, ou o host do Ollama está errado.
Verifica o ollama list e o valor de --host. Os erros são capturados por caso, não lançados,
por isso o resto da execução conclui à mesma.
Verificar contains/regex não é demasiado simplista para evals?¶
Para tarefas determinísticas (factos, JSON, formatos) é exatamente adequado e rápido. Para
qualidade aberta, usa os checks como filtro e inspeciona report.results[].output para o teu
próprio scoring, ou acrescenta um check avaliado por modelo.
Como torno os resultados comparáveis?¶
Restringe os prompts ("responde numa palavra", "só JSON") para os checks fazerem sentido, e
mantém a mesma suite entre modelos. Combina um check de correção com maxLatencyMs.
Posso correr cada caso várias vezes?¶
Ainda não de raiz — uma passagem por modelo. Repetições e relatório de variância estão no roadmap; PRs bem-vindos.
O que conta a "pass rate"?¶
A fração de todos os checks em todos os casos que passaram para esse modelo, não só casos inteiros — por isso o crédito parcial aparece.