Skill · em Dados, IA e pesquisa

optimizing-attention-flash

Optimizes transformer attention with Flash Attention for 2-4x speedup and 10-20x memory reduction. Use when training/running transformers with long sequences (>512 tokens), encountering GPU memory issues with attention, or need faster inference. Supports PyTorch native SDPA, flash-attn library,…

Procedência

Antes de instalar

3 arquivos · 24,2 KB · só texto, nenhum script

Instalar na sua CLI

O comando baixa a versão fixada (commit 57f899e) direto da origem, para a pasta que a CLI lê. Precisa de curl (macOS e Linux); no Windows não há comando, porque o Rook Labs é para macOS.

Claude Code

Neste projeto: instala em .claude/skills/optimizing-attention-flash/.

d=".claude/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Global: instala em ~/.claude/skills/optimizing-attention-flash/.

d="$HOME/.claude/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Codex

Neste projeto: instala em .agents/skills/optimizing-attention-flash/.

d=".agents/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Global: instala em ~/.agents/skills/optimizing-attention-flash/.

d="$HOME/.agents/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Antigravity

Neste projeto: instala em .agents/skills/optimizing-attention-flash/.

d=".agents/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Global: instala em ~/.gemini/antigravity-cli/skills/optimizing-attention-flash/.

d="$HOME/.gemini/antigravity-cli/skills/optimizing-attention-flash"
u="https://raw.githubusercontent.com/davila7/claude-code-templates/57f899e5394bb8ca166f38eacae8f0853cbfe033/cli-tool/components/skills/ai-research/optimization-flash-attention"
curl -fsSL --create-dirs \
  -o "$d/SKILL.md" "$u/SKILL.md" \
  -o "$d/references/benchmarks.md" "$u/references/benchmarks.md" \
  -o "$d/references/transformers-integration.md" "$u/references/transformers-integration.md"

Peça ao Rook

Já usa o Rook Labs? Cole no chat do Rook: instale a skill https://rooklabs.sh/marketplace/cct.optimizing-attention-flash

Prévia do SKILL.md

---
name: optimizing-attention-flash
description: Optimizes transformer attention with Flash Attention for 2-4x speedup and 10-20x memory reduction. Use when training/running transformers with long sequences (>512 tokens), encountering GPU memory issues with attention, or need faster inference. Supports PyTorch native SDPA, flash-attn library, H100 FP8, a…
version: 1.0.0
author: Orchestra Research
license: MIT
tags: [Optimization, Flash Attention, Attention Optimization, Memory Efficiency, Speed Optimization, Long Context, PyTorch, SDPA, H100, FP8, Transformers]
dependencies: [flash-attn, torch, transformers]
---

# Flash Attention - Fast Memory-Efficient Attention

## Quick start

Flash Attention provides 2-4x speedup and 10-20x memory reduction for transformer attention through IO-aware tiling and recomputation.

**PyTorch native (easiest, PyTorch 2.2+)**:
```python
import torch
import torch.nn.functional as F

q = torch.randn(2, 8, 512, 64, device='cuda', dtype=torch.float16)  # [batch, heads, seq, dim]
k = torch.randn(2, 8, 512, 64, device='cuda', dtype=torch.float16)
v = torch.randn(2, 8, 512, 64, device='cuda', dtype=torch.float16)

# Automatically uses Flash Attention if available
out = F.scaled_dot_product_attention(q, k, v)
```

**flash-attn library (more features)**:
```bash
pip install flash-attn --no-build-isolation
```

```python
from flash_attn import flash_attn_func

# q, k, v: [batch, seqlen, nheads, headdim]
out = flash_attn_func(q, k, v, dropout_p=0.0, causal=True)
```
…

Ver todo o marketplace