Skip to content

FAQ & resolução de problemas

Preciso de internet?

Não. O ollabench fala com o teu servidor Ollama local; puxa os modelos primeiro (ollama pull llama3.2) e tudo corre offline.

Um modelo mostra ⚠️ / 0 passados

Esse modelo deu erro no caso — normalmente não está puxado, ou o host do Ollama está errado. Verifica o ollama list e o valor de --host. Os erros são capturados por caso, não lançados, por isso o resto da execução conclui à mesma.

Verificar contains/regex não é demasiado simplista para evals?

Para tarefas determinísticas (factos, JSON, formatos) é exatamente adequado e rápido. Para qualidade aberta, usa os checks como filtro e inspeciona report.results[].output para o teu próprio scoring, ou acrescenta um check avaliado por modelo.

Como torno os resultados comparáveis?

Restringe os prompts ("responde numa palavra", "só JSON") para os checks fazerem sentido, e mantém a mesma suite entre modelos. Combina um check de correção com maxLatencyMs.

Posso correr cada caso várias vezes?

Ainda não de raiz — uma passagem por modelo. Repetições e relatório de variância estão no roadmap; PRs bem-vindos.

O que conta a "pass rate"?

A fração de todos os checks em todos os casos que passaram para esse modelo, não só casos inteiros — por isso o crédito parcial aparece.