Skill · em Dados, IA e pesquisa
evaluating-llms-harness
Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace,…
Procedência
- Origem: davila7/claude-code-templates
- Caminho:
cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness - Versão fixada:
57f899e5394bb8ca166f38eacae8f0853cbfe033 - Licença: MIT
- Espelhado em 25/09/2026
- 1 download no Claude Code Templates (lido em 25/09/2026)
Antes de instalar
5 arquivos · 57 KB · só texto, nenhum script
Instalar na sua CLI
O comando baixa a versão fixada (commit 57f899e) direto da origem, para a pasta que a CLI lê. Precisa de curl (macOS e Linux); no Windows não há comando, porque o Rook Labs é para macOS.
Claude Code
Neste projeto: instala em .claude/skills/evaluating-llms-harness/.
d=".claude/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Global: instala em ~/.claude/skills/evaluating-llms-harness/.
d="$HOME/.claude/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Codex
Neste projeto: instala em .agents/skills/evaluating-llms-harness/.
d=".agents/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Global: instala em ~/.agents/skills/evaluating-llms-harness/.
d="$HOME/.agents/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Antigravity
Neste projeto: instala em .agents/skills/evaluating-llms-harness/.
d=".agents/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Global: instala em ~/.gemini/antigravity-cli/skills/evaluating-llms-harness/.
d="$HOME/.gemini/antigravity-cli/skills/evaluating-llms-harness" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/evaluation-lm-evaluation-harness" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/api-evaluation.md" "$u/references/api-evaluation.md" \ -o "$d/references/benchmark-guide.md" "$u/references/benchmark-guide.md" \ -o "$d/references/custom-tasks.md" "$u/references/custom-tasks.md" \ -o "$d/references/distributed-eval.md" "$u/references/distributed-eval.md"
Peça ao Rook
Já usa o Rook Labs? Cole no chat do Rook: instale a skill https://rooklabs.sh/marketplace/cct.evaluating-llms-harness
Prévia do SKILL.md
---
name: evaluating-llms-harness
description: Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting academic results, or tracking training progress. Industry standard used by EleutherAI, HuggingFace, and major labs. Supports HuggingFace, vLLM, API…
version: 1.0.0
author: Orchestra Research
license: MIT
tags: [Evaluation, LM Evaluation Harness, Benchmarking, MMLU, HumanEval, GSM8K, EleutherAI, Model Quality, Academic Benchmarks, Industry Standard]
dependencies: [lm-eval, transformers, vllm]
---
# lm-evaluation-harness - LLM Benchmarking
## Quick start
lm-evaluation-harness evaluates LLMs across 60+ academic benchmarks using standardized prompts and metrics.
**Installation**:
```bash
pip install lm-eval
```
**Evaluate any HuggingFace model**:
```bash
lm_eval --model hf \
--model_args pretrained=meta-llama/Llama-2-7b-hf \
--tasks mmlu,gsm8k,hellaswag \
--device cuda:0 \
--batch_size 8
```
**View available tasks**:
```bash
lm_eval --tasks list
```
## Common workflows
### Workflow 1: Standard benchmark evaluation
Evaluate model on core benchmarks (MMLU, GSM8K, HumanEval).
…