evaluation
Métodos y frameworks para evaluar el rendimiento de agentes, creación de rúbricas multidimensionales y validación de estrategias de ingeniería de contexto.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
Métodos y frameworks para evaluar el rendimiento de agentes, creación de rúbricas multidimensionales y validación de estrategias de ingeniería de contexto.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
Master of Purposeful Motion & Micro-interactions. Expert in natural easing, GPU-accelerated animations, and Framer Motion for high-end interfaces.
Senior Context Architect & Memory Engineer. Expert in Automated Context Packing, Symbol Indexing, and Agent Rehydration for 2026.
Senior Design System Architect & Token Engineer for 2026. Specialized in layered design tokens, Tailwind 4 CSS-first themes, and headless UI orchestration using Radix. Expert in building multi-brand, multi-theme systems with high architectural integrity, automated documentation-as-code, and AI-driven drift detection.
Primary Instruction Protocol for Senior Engineering Agents. Expert in Cognitive Architectures, Memory Systems, and 2026 Context Engineering (Updated for v0.27.0).
Master of Interface Resilience & Production Edge Cases. Expert in error handling, internationalization (i18n), and extreme data constraints.
Supreme Code Quality Gatekeeper. Expert in Resolving the AI Verification Gap, Quality Metrics, and Elite Coding Standards for 2026.
| name | evaluation |
| description | Métodos y frameworks para evaluar el rendimiento de agentes, creación de rúbricas multidimensionales y validación de estrategias de ingeniería de contexto. |
Esta habilidad permite evaluar sistemáticamente el rendimiento de agentes autónomos. A diferencia del software tradicional, los agentes son no-deterministas y pueden alcanzar un objetivo por múltiples caminos válidos. La evaluación debe centrarse en los resultados (Outcomes) y la eficiencia del proceso.
Mental Model: La evaluación no es binaria (pasa/falla); es una medición multidimensional de la probabilidad de éxito y la calidad del razonamiento.
Estudios demuestran que tres factores explican casi todo el rendimiento de un agente:
Define criterios con pesos específicos según la importancia para el proyecto.
| Dimensión | Peso | Descripción |
|---|---|---|
| Precisión Factual | 0.35 | Los hechos coinciden con la fuente de verdad. |
| Completitud | 0.25 | Cubre todos los aspectos solicitados. |
| Eficiencia | 0.20 | Usa el número mínimo de herramientas necesarias. |
| Formato | 0.20 | Sigue el esquema JSON/Markdown esperado. |
Divide tu set de tests en niveles:
context-fundamentals: Evaluación de cómo el modelo usa el contexto proporcionado.context-degradation: Detección de caídas de rendimiento en contextos largos.advanced-evaluation: Implementación técnica de "LLM-as-a-Judge".references/metrics.md: Definiciones detalladas de métricas, implementación de rúbricas y runners de evaluación.