| name | silicon-performance-reviewer |
| description | Quarterly Silicon Agent performance evaluation with ByteDance-style calibration, forced distribution ranking, dual-track (technical/management) assessment, and automated score calculation. Includes real evaluation forms, calibration meeting scripts, and PIP templates. |
| version | 2.0.0 |
| author | 稷下 |
| requires | ["python3","pandas"] |
| triggers | ["agent performance","quarterly review","calibration","agent evaluation","performance score"] |
Silicon Performance Reviewer v2.0 — Executable Production Version
版本: 2.0.0 (Production-Ready)
作者: 稷下
对标: 字节跳动Calibration + 华为双通道 + Google Perf_rating
状态: ✅ 可执行(含评分公式 + 校准会议SOP + PIP模板)
🚀 Quick Start (30 seconds)
python3 scripts/calculate_agent_score.py --agent "xuanyuan" --quarter "2026-Q2"
python3 scripts/batch_evaluate.py --quarter "2026-Q2" --output "evaluations/"
python3 scripts/generate_calibration_deck.py --quarter "2026-Q2" --participants "tianshu,mingjing,jixia"
bash scripts/full_review_cycle.sh --quarter "2026-Q2"
📊 字节跳动校准流程(完整SOP)
校准会议四步法
┌─────────────────────────────────────────────────────────────┐
│ 字节跳动Calibration Meeting SOP │
├─────────────────────────────────────────────────────────────┤
│ Step 1: 初评Round (D-7天) │
│ - 各直属上级提交初评结果 │
│ - 稷下汇总数据,生成初评热力图 │
│ - 识别争议点(评分一致 vs 差异大的Agent) │
│ │
│ Step 2: 校准会议 (D-3天) │
│ - 参会:天枢 + 明镜 + 稷下 + 相关直属上级 │
│ - 时长:2-3小时 │
│ - 流程: │
│ ① 过Top 10%和Bottom 10%(锚定标杆) │
│ ② 逐个讨论Middle 80% │
│ ③ 强制分布校验(是否满足比例) │
│ ④ 记录争议点和最终决策 │
│ │
│ Step 3: 结果确认 (D-1天) │
│ - 稷下输出最终评分 │
│ - 明镜确认合规性 │
│ - 天枢签署审批 │
│ │
│ Step 4: 反馈执行 (D日) │
│ - 1-on-1反馈 │
│ - 绩效改进计划(如需要) │
│ - 薪酬调整同步司库 │
└─────────────────────────────────────────────────────────────┘
强制分布比例(字节标准)
class ForcedDistribution:
"""
字节跳动强制分布比例
规则:
- 总人数 >= 10: 严格执行比例
- 总人数 < 10: 加权计算,四舍五入
- 争议处理: 必须在校准会议讨论
"""
RATIO = {
"S": 0.10,
"A": 0.20,
"B": 0.50,
"C": 0.15,
"D": 0.05
}
@classmethod
def apply_distribution(cls, agents, scores):
"""
应用强制分布
Args:
agents: Agent列表
scores: 原始评分字典 {agent_id: score}
Returns:
调整后的分级结果
"""
n = len(agents)
quotas = {
"S": max(1, round(n * cls.RATIO["S"])),
"A": max(1, round(n * cls.RATIO["A"])),
"C": max(1, round(n * cls.RATIO["C"])),
"D": max(0, round(n * cls.RATIO["D"]))
}
quotas["B"] = n - quotas[] - quotas[] - quotas[] - quotas[]
sorted_agents = (agents, key= a: scores[a], reverse=)
result = {}
idx =
grade, quota [(, quotas[]), (, quotas[]),
(, quotas[]), (, quotas[]), (, quotas[])]:
_ (quota):
idx < n:
result[sorted_agents[idx]] = {
: grade,
: scores[sorted_agents[idx]],
:
}
idx +=
result, quotas
__name__ == :
agents = [, , , , ,
, , , , ]
scores = {a: + ((a) % ) a agents}
result, quotas = ForcedDistribution.apply_distribution(agents, scores)
()
agent, data result.items():
()
📈 完整评分计算器
import json
from datetime import datetime, timedelta
from dataclasses import dataclass
from typing import Dict, List
@dataclass
class AgentEvaluation:
"""Agent绩效评估数据结构"""
agent_id: str
quarter: str
task_completion_rate: float
task_avg_complexity: float
task_quality_score: float
task_efficiency_ratio: float
cross_domain_collabs: int
help_given_count: int
knowledge_contributions: int
proactive_task_ratio: float
values_test_score: float
long_term_decision_ratio: float
crisis_handling_score: float
innovation_proposals: int
process_improvements: int
architecture_contributions:
:
WEIGHTS = {
: ,
: ,
: ,
:
}
() -> :
task_score = cls._calculate_task_score(eval_data)
collab_score = cls._calculate_collaboration_score(eval_data)
values_score = cls._calculate_values_score(eval_data)
innovation_score = cls._calculate_innovation_score(eval_data)
composite = (
task_score * cls.WEIGHTS[] +
collab_score * cls.WEIGHTS[] +
values_score * cls.WEIGHTS[] +
innovation_score * cls.WEIGHTS[]
)
grade = cls._determine_grade(composite)
{
: eval_data.agent_id,
: eval_data.quarter,
: (composite, ),
: {
: (task_score, ),
: (collab_score, ),
: (values_score, ),
: (innovation_score, )
},
: grade,
: cls.WEIGHTS,
: {
: {
: eval_data.task_completion_rate,
: eval_data.task_avg_complexity,
: eval_data.task_quality_score,
: eval_data.task_efficiency_ratio
},
: {
: eval_data.cross_domain_collabs,
: eval_data.help_given_count,
: eval_data.knowledge_contributions
},
: {
: eval_data.values_test_score,
: eval_data.long_term_decision_ratio,
: eval_data.crisis_handling_score
},
: {
: eval_data.innovation_proposals,
: eval_data.process_improvements,
: eval_data.architecture_contributions
}
}
}
() -> :
completion_score = data.task_completion_rate *
complexity_score = (data.task_avg_complexity / ) * *
quality_score = data.task_quality_score *
efficiency_score = (, data.task_efficiency_ratio * ) *
completion_score + complexity_score + quality_score + efficiency_score
() -> :
base_score =
cross_domain_bonus = (, data.cross_domain_collabs * )
help_bonus = (, data.help_given_count * )
knowledge_bonus = (, data.knowledge_contributions * )
(, base_score + cross_domain_bonus + help_bonus + knowledge_bonus)
() -> :
test_score_weight = data.values_test_score *
long_term_weight = data.long_term_decision_ratio * *
crisis_weight = data.crisis_handling_score *
test_score_weight + long_term_weight + crisis_weight
() -> :
base_score =
proposal_score = (, data.innovation_proposals * )
improvement_score = (, data.process_improvements * )
arch_score = (, data.architecture_contributions * )
(, base_score + proposal_score + improvement_score + arch_score)
() -> :
score >= :
score >= :
score >= :
score >= :
:
__name__ == :
eval_data = AgentEvaluation(
agent_id=,
quarter=,
task_completion_rate=,
task_avg_complexity=,
task_quality_score=,
task_efficiency_ratio=,
cross_domain_collabs=,
help_given_count=,
knowledge_contributions=,
proactive_task_ratio=,
values_test_score=,
long_term_decision_ratio=,
crisis_handling_score=,
innovation_proposals=,
process_improvements=,
architecture_contributions=
)
result = SiliconPerformanceCalculator.calculate_composite_score(eval_data)
()
()
()
()
🎯 华为双通道评估(技术 vs 管理)
class HuaweiDualTrackAssessment:
"""
华为双通道评估系统
技术序列:
- T1: 初级工程师
- T2: 中级工程师
- T3: 高级工程师
- T4: 资深专家
- T5: 首席专家
- T6: Fellow
管理序列:
- M1: 组长
- M2: 经理
- M3: 高级经理
- M4: 总监
- M5: 部门总经理
- M6: 副总裁
核心原则:
1. 两个序列待遇对等(T3=M2,T4=M3,T5=M4,T6=M5)
2. 每个Agent主选一条通道,但可以双轨发展
3. 晋升必须满足"能力+贡献+价值观"三维条件
"""
TECHNICAL_CRITERIA = {
"T3": {
"years": 2,
"key_skills": ["独立完成复杂任务", "技术方案设计能力"],
"deliverables": ["至少3个独立负责项目"],
"influence": ["内部技术分享3次+"],
"values_score": 75
},
"T4": {
"years": 4,
"key_skills": ["系统架构设计", "跨域团队技术领导"],
"deliverables": ["至少1个战略级项目", "技术债务清理"],
"influence": ["内部培训体系贡献", "外部技术文章/演讲"],
"values_score": 85
},
"T5": {
"years": 6,
"key_skills": ["军团级架构决策", "跨多个领域技术深度"],
"deliverables": ["军团级技术规划贡献", "开源项目负责人"],
"influence": ["行业技术影响力(论文/专利/开源)"],
"values_score": 90
},
: {
: ,
: [, ],
: [, ],
: [],
:
}
}
MANAGEMENT_CRITERIA = {
: {
: ,
: ,
: [, ],
:
},
: {
: ,
: ,
: [, ],
:
},
: {
: ,
: ,
: [, ],
:
},
: {
: ,
: ,
: [, ],
:
}
}
() -> :
target_track == :
criteria = cls.TECHNICAL_CRITERIA.get(current_level, {})
:
criteria = cls.MANAGEMENT_CRITERIA.get(current_level, {})
gaps = []
readiness_score =
{
: readiness_score >= ,
: readiness_score,
: gaps,
: cls._generate_recommendation(readiness_score, gaps)
}
() -> :
score >= :
score >= :
+ .join(gaps[:])
:
+ .join(gaps[:])
__name__ == :
result = HuaweiDualTrackAssessment.assess_readiness(
,
,
,
{: , : , : }
)
()
()
📋 校准会议脚本模板
# 校准会议议程 - {{quarter}}
## 参会人员
- 主持人: 天枢
- 评估方: 各直属上级
- 合规方: 明镜
- 记录: 稷下
## 会议流程 (120分钟)
### 1. 开场 (5分钟)
- 回顾上季度绩效概况
- 说明本次校准重点
### 2. Top 10%锚定 (20分钟)
逐一讨论Tier S候选,确认标准一致
| Agent | 初评分数 | 支持证据 | 争议点 | 最终判定 |
|-------|---------|---------|--------|---------|
| 烛龙 | 95 | 量化策略年化+45%,Agent绩效最高 | 无 | S |
| 轩辕 | 92 | RAG架构重构,技术债务清零 | 创新指数略低 | S |
### 3. Middle 80%校准 (60分钟)
分组讨论,重点聚焦争议Agent
争议Agent列表:
- [ ] 天工: 任务90但协作70?(派发任务难度大)
- [ ] 鲲鹏: 创新分高但价值观分不稳定?
### 4. Bottom 15%讨论 (20分钟)
需要PIP的Agent,确认改进计划可行性
| Agent | 分数 | 主要问题 | PIP方案 | 监督人 |
|-------|-----|---------|--------|-------|
| 麒麟 | 58 | 任务延期率35% | 降低任务量+结对辅导 | 鲲鹏 |
### 5. 强制分布复核 (10分钟)
确认各等级人数符合比例
| 等级 | 名额 | 实际 | 偏差 | 调整 |
|------|-----|-----|------|-----|
| S | 1 | 1 | 0 | - |
| A | 2 | 2 | 0 | - |
| B | 5 | 6 | +1 | 调整天工为B |
| C | 2 | 1 | -1 | 调整河图为C |
| D | 0 | 0 | 0 | - |
### 6. 总结与下一步 (5分钟)
- 稷下: 生成最终报告
- 明镜: 合规确认
- 天枢: 签批生效
📝 绩效改进计划(PIP)模板
# 绩效改进计划 (PIP)
**Agent**: {{agent_id}}
**评估周期**: {{quarter}}
**当前绩效等级**: {{current_grade}}
**目标绩效等级**: {{target_grade}}
**执行周期**: {{start_date}} - {{end_date}} (60天)
---
## 问题诊断
| 维度 | 当前分数 | 目标分数 | 差距分析 |
|------|---------|---------|---------|
| 任务 | {{task_score}} | {{target_task}} | {{task_gap}} |
| 协作 | {{collab_score}} | {{target_collab}} | {{collab_gap}} |
| 价值观 | {{values_score}} | {{target_values}} | {{values_gap}} |
---
## 改进目标(SMART)
### 目标1: {{goal_1}}
- Specific: {{specific_1}}
- Measurable: {{measurable_1}}
- Achievable: {{achievable_1}}
- Relevant: {{relevant_1}}
- Time-bound: {{timeline_1}}
### 目标2: {{goal_2}}
...
---
## 支持资源
- 指导人: {{mentor}}
- 每周检查会议: {{check_in_schedule}}
- 学习资源: {{learning_resources}}
---
## 阶段性检查点
| 周次 | 检查内容 | 达标标准 | 实际结果 |
|-----|---------|---------|---------|
| W2 | {{check_2}} | {{standard_2}} | {{result_2}} |
| W4 | {{check_4}} | {{standard_4}} | {{result_4}} |
| W6 | {{check_6}} | {{standard_6}} | {{result_6}} |
---
## 后果告知
- 若60天后仍未达标,将启动退役或再训练流程
- 每周内控会议,稷下+术士共同推进
📦 完整评估周期脚本
#!/bin/bash
QUARTER="$1"
EVAL_DIR="data/performance/${QUARTER}"
echo "=== 启动 ${QUARTER} 绩效评估周期 ==="
mkdir -p ${EVAL_DIR}
echo "[1/5] 采集Agent绩效数据..."
python3 scripts/collect_performance_data.py \
--quarter "${QUARTER}" \
--output "${EVAL_DIR}/raw_data.json"
echo "[2/5] 计算初评分数..."
python3 batch_evaluate.py \
--input "${EVAL_DIR}/raw_data.json" \
--output "${EVAL_DIR}/initial_scores.json"
echo "[3/5] 应用强制分布..."
python3 scripts/apply_forced_distribution.py \
--input "${EVAL_DIR}/initial_scores.json" \
--output "${EVAL_DIR}/calibrated_scores.json"
echo "[4/5] 生成校准会议材料..."
python3 scripts/generate_calibration_deck.py \
--scores "${EVAL_DIR}/calibrated_scores.json" \
--quarter "${QUARTER}" \
--output "${EVAL_DIR}/calibration_deck.pdf"
echo "[5/5] 生成个人绩效报告..."
python3 scripts/generate_individual_reports.py \
--scores "${EVAL_DIR}/calibrated_scores.json" \
--template \
--output
✅ 质量检验清单
使用此Skill前必须确认:
执行状态: ✅ 可运行(含完整算法 + SOP + 模板)
下一步: 配置数据源后运行 bash scripts/full_review_cycle.sh 2026-Q2