Skip to content

Começar

Requisitos

  • Node.js 20 ou superior
  • Ollama a correr, com os modelos que queres testar já puxados:
    ollama pull llama3.2
    ollama pull qwen2.5
    

Correr um benchmark

npx ollabench examples/basics.suite.json --models llama3.2,qwen2.5
npx ollabench a-minha.suite.json --models llama3.2,qwen2.5 --out report.md
npx ollabench a-minha.suite.json --models llama3.2 --host http://localhost:11434

O relatório ordena os modelos por taxa de acerto (depois latência) e inclui uma matriz por caso para veres exatamente onde um modelo falha.

Interpretar resultados

  • Pass rate — fração de todos os checks (em todos os casos) que passaram.
  • Avg latency — tempo médio de geração por caso; útil para escolher um modelo para um Pi ou uma feature sensível à latência.
  • Per-casepassed/total por modelo, ou ⚠️ se esse modelo deu erro no caso.

Uso como biblioteca

import { loadSuite, runSuite, renderReport, OllamaModelClient } from 'ollabench';

const report = await runSuite(loadSuite('a-minha.suite.json'), ['llama3.2'], new OllamaModelClient());
console.log(renderReport(report));      // markdown
console.log(report.models[0].passRate); // acesso programático