Skip to main content

teaching-claude-why-alignment

Alignment training methodology from Anthropic's "Teaching Claude why" research (May 2026). Use when fine-tuning or RLHF-aligning LLMs against adversarial/misalignment evals, or designing OOD-generalizing safety training data. Covers four lessons: demonstrations alone are insufficient, teach principles/reasons rather than only actions, OOD "difficult advice" data generalizes better than in-distribution honeypot data, and augmenting training data with tool definitions/constitution documents.

Ir a la instalación

Datos de origen

Repositorio
hiyenwong/ai_collection
Última actividad en el origen
14 de julio de 2026 a las 01:05
Idioma detectado de SKILL.md
inglés
Estrellas
2
Forks
0

Opciones de instalación

De forma predeterminada está seleccionado el prompt que primero revisa el origen. Puedes cambiar a un comando directo o descargar una copia local.

Revisa los archivos de origen

Lee SKILL.md y los archivos complementarios que muestra SkillsMP antes de decidir si quieres instalarlo.