Skill · em Dados, IA e pesquisa
simpo-training
Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0). No reference model needed, more efficient than DPO. Use for preference alignment when want simpler, faster training than DPO/PPO.
Procedência
- Origem: davila7/claude-code-templates
- Caminho:
cli-tool/components/skills/ai-research/post-training-simpo - Versão fixada:
57f899e5394bb8ca166f38eacae8f0853cbfe033 - Licença: MIT
- Espelhado em 25/09/2026
- nenhum download no Claude Code Templates (lido em 25/09/2026)
Antes de instalar
4 arquivos · 31,6 KB · só texto, nenhum script
Instalar na sua CLI
O comando baixa a versão fixada (commit 57f899e) direto da origem, para a pasta que a CLI lê. Precisa de curl (macOS e Linux); no Windows não há comando, porque o Rook Labs é para macOS.
Claude Code
Neste projeto: instala em .claude/skills/simpo-training/.
d=".claude/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Global: instala em ~/.claude/skills/simpo-training/.
d="$HOME/.claude/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Codex
Neste projeto: instala em .agents/skills/simpo-training/.
d=".agents/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Global: instala em ~/.agents/skills/simpo-training/.
d="$HOME/.agents/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Antigravity
Neste projeto: instala em .agents/skills/simpo-training/.
d=".agents/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Global: instala em ~/.gemini/antigravity-cli/skills/simpo-training/.
d="$HOME/.gemini/antigravity-cli/skills/simpo-training" u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/post-training-simpo" curl -fsSL --create-dirs \ -o "$d/SKILL.md" "$u/SKILL.md" \ -o "$d/references/datasets.md" "$u/references/datasets.md" \ -o "$d/references/hyperparameters.md" "$u/references/hyperparameters.md" \ -o "$d/references/loss-functions.md" "$u/references/loss-functions.md"
Peça ao Rook
Já usa o Rook Labs? Cole no chat do Rook: instale a skill https://rooklabs.sh/marketplace/cct.simpo-training
Prévia do SKILL.md
---
name: simpo-training
description: Simple Preference Optimization for LLM alignment. Reference-free alternative to DPO with better performance (+6.4 points on AlpacaEval 2.0). No reference model needed, more efficient than DPO. Use for preference alignment when want simpler, faster training than DPO/PPO.
version: 1.0.0
author: Orchestra Research
license: MIT
tags: [Post-Training, SimPO, Preference Optimization, Alignment, DPO Alternative, Reference-Free, LLM Alignment, Efficient Training]
dependencies: [torch, transformers, datasets, trl, accelerate]
---
# SimPO - Simple Preference Optimization
## Quick start
SimPO is a reference-free preference optimization method that outperforms DPO without needing a reference model.
**Installation**:
```bash
# Create environment
conda create -n simpo python=3.10 && conda activate simpo
# Install PyTorch 2.2.2
# Visit: https://pytorch.org/get-started/locally/
# Install alignment-handbook
git clone https://github.com/huggingface/alignment-handbook.git
cd alignment-handbook
python -m pip install .
# Install Flash Attention 2
python -m pip install flash-attn --no-build-isolation
```
**Training** (Mistral 7B):
```bash
ACCELERATE_LOG_LEVEL=info accelerate launch \
--config_file accelerate_configs/deepspeed_zero3.yaml \
scripts/run_simpo.py \
training_configs/mistral-7b-base-simpo.yaml
```
…