Skip to main content

teaching-claude-why-alignment

Alignment training methodology from Anthropic's "Teaching Claude why" research (May 2026). Use when fine-tuning or RLHF-aligning LLMs against adversarial/misalignment evals, or designing OOD-generalizing safety training data. Covers four lessons: demonstrations alone are insufficient, teach principles/reasons rather than only actions, OOD "difficult advice" data generalizes better than in-distribution honeypot data, and augmenting training data with tool definitions/constitution documents.

Ir para a instalação

Informações da origem

Repositório
hiyenwong/ai_collection
Última atividade na origem
14 de julho de 2026 às 01:05
Idioma detectado do SKILL.md
inglês
Estrelas
2
Forks
0

Opções de instalação

Por padrão, está selecionado o prompt que primeiro revisa a origem. Você pode mudar para um comando direto ou baixar uma cópia local.

Revise os arquivos de origem

Leia o SKILL.md e os arquivos complementares exibidos pelo SkillsMP antes de decidir se vai instalar.