Começar¶
Requisitos¶
- Node.js 20 ou superior
- Ollama a correr, com os modelos que queres testar já puxados:
Correr um benchmark¶
npx ollabench examples/basics.suite.json --models llama3.2,qwen2.5
npx ollabench a-minha.suite.json --models llama3.2,qwen2.5 --out report.md
npx ollabench a-minha.suite.json --models llama3.2 --host http://localhost:11434
O relatório ordena os modelos por taxa de acerto (depois latência) e inclui uma matriz por caso para veres exatamente onde um modelo falha.
Interpretar resultados¶
- Pass rate — fração de todos os checks (em todos os casos) que passaram.
- Avg latency — tempo médio de geração por caso; útil para escolher um modelo para um Pi ou uma feature sensível à latência.
- Per-case —
passed/totalpor modelo, ou ⚠️ se esse modelo deu erro no caso.