Skill · em Dados, IA e pesquisa

evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace,…

Procedência

Antes de instalar

5 arquivos · 57 KB · só texto, nenhum script

Instalar na sua CLI

O comando baixa a versão fixada (commit 57f899e) direto da origem, para a pasta que a CLI lê. Precisa de curl (macOS e Linux); no Windows não há comando, porque o Rook Labs é para macOS.

Claude Code

Neste projeto: instala em .claude/skills/evaluating-llms-harness/.

d=".claude/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Global: instala em ~/.claude/skills/evaluating-llms-harness/.

d="$HOME/.claude/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Codex

Neste projeto: instala em .agents/skills/evaluating-llms-harness/.

d=".agents/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Global: instala em ~/.agents/skills/evaluating-llms-harness/.

d="$HOME/.agents/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Antigravity

Neste projeto: instala em .agents/skills/evaluating-llms-harness/.

d=".agents/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Global: instala em ~/.gemini/antigravity-cli/skills/evaluating-llms-harness/.

d="$HOME/.gemini/antigravity-cli/skills/evaluating-llms-harness"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \
  -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \
  -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \
  -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"

Peça ao Rook

Já usa o Rook Labs? Cole no chat do Rook: instale a skill https://rooklabs.sh/marketplace/cct.evaluating-llms-harness

Prévia do SKILL.md

---
name: evaluating-llms-harness
description: Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, API…
version: 1.0.0
author: Orchestra Research
license: MIT
tags: [Evaluation, LM Evaluation Harness, Benchmarking, MMLU, HumanEval, GSM8K, EleutherAI, Model Quality, Academic Benchmarks, Industry Standard]
dependencies: [lm-eval, transformers, vllm]
---

# lm-evaluation-harness - LLM Benchmarking

## Quick start

lm-evaluation-harness evaluates LLMs across 60+ academic benchmarks using standardized prompts and metrics.

**Installation**:
```bash
pip install lm-eval
```

**Evaluate any HuggingFace model**:
```bash
lm_eval --model hf \
  --model_args pretrained=meta-llama/Llama-2-7b-hf \
  --tasks mmlu,gsm8k,hellaswag \
  --device cuda:0 \
  --batch_size 8
```

**View available tasks**:
```bash
lm_eval --tasks list
```

## Common workflows

### Workflow 1: Standard benchmark evaluation

Evaluate model on core benchmarks (MMLU, GSM8K, HumanEval).
…

Ver todo o marketplace