advanced-evaluation
Implementación de "LLM-as-a-Judge", comparación de outputs, creación de rúbricas de evaluación y mitigación de sesgos en sistemas de IA.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
Implementación de "LLM-as-a-Judge", comparación de outputs, creación de rúbricas de evaluación y mitigación de sesgos en sistemas de IA.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
| name | advanced-evaluation |
| description | Implementación de "LLM-as-a-Judge", comparación de outputs, creación de rúbricas de evaluación y mitigación de sesgos en sistemas de IA. |
Esta habilidad permite implementar sistemas de evaluación de grado de producción utilizando LLMs como jueces. Cubre desde la taxonomía de evaluación hasta la mitigación de sesgos sistemáticos (posición, longitud, auto-mejora).
Mental Model: La evaluación no es un evento, es un pipeline. El "LLM-as-a-Judge" no es una técnica única, sino un framework de decisiones basado en la naturaleza del dato (objetivo vs. subjetivo).
| Enfoque | Mejor para... | Fiabilidad | Fallo Común |
|---|---|---|---|
| Direct Scoring | Criterios Objetivos (Factualidad, Formato) | Alta | Deriva de escala (calibration drift) |
| Pairwise Comparison | Criterios Subjetivos (Tono, Estilo, Creatividad) | Muy Alta | Sesgo de posición (Position Bias) |
Utiliza thinking-pro para razonar sobre la evidencia antes de emitir el score.
## Task
Evalúa la calidad de la respuesta según los criterios.
## Criterios
- Precisión Factual (Peso: 1.0)
- Concisión (Peso: 0.5)
## Instrucciones
1. Busca evidencia específica en la respuesta.
2. Razona sobre cómo la evidencia cumple o no el criterio.
3. Asigna un score (1-5).
4. Sugiere una mejora atómica.
## Formato de Salida (JSON)
{ "score": number, "reasoning": string, "improvement": string }
Es obligatorio realizar el "Swap Test" para asegurar la integridad de la evaluación.
Una rúbrica bien definida reduce la varianza en un 40-60%.
context-fundamentals: Estructura de prompts de evaluación.tool-design: Creación de herramientas de validación programática.debug-master: Identificación de fallos sistémicos en la lógica del modelo.references/bias-mitigation.md: Técnicas avanzadas de Swap y PoLL (Panel of LLMs).references/implementation-patterns.md: Patrones técnicos de "Reasoning-First" y "Swap Test".references/metrics-guide.md: Selección de métricas (Factualidad, Tono, Formato).Master of Purposeful Motion & Micro-interactions. Expert in natural easing, GPU-accelerated animations, and Framer Motion for high-end interfaces.
Senior Context Architect & Memory Engineer. Expert in Automated Context Packing, Symbol Indexing, and Agent Rehydration for 2026.
Senior Design System Architect & Token Engineer for 2026. Specialized in layered design tokens, Tailwind 4 CSS-first themes, and headless UI orchestration using Radix. Expert in building multi-brand, multi-theme systems with high architectural integrity, automated documentation-as-code, and AI-driven drift detection.
Primary Instruction Protocol for Senior Engineering Agents. Expert in Cognitive Architectures, Memory Systems, and 2026 Context Engineering (Updated for v0.27.0).
Master of Interface Resilience & Production Edge Cases. Expert in error handling, internationalization (i18n), and extreme data constraints.
Supreme Code Quality Gatekeeper. Expert in Resolving the AI Verification Gap, Quality Metrics, and Elite Coding Standards for 2026.