| name | project-evaluator |
| description | RAG/Agent 项目评估与求职辅导 Skill。扫描项目代码库,从工程架构(30%)、算法深度(25%)、产品完整度(20%)、可观测性(15%)、文档影响力(10%)五个维度量化评分(0-100),判定项目级别(L1-L4),识别短板并生成改进路线图。输出算法岗/开发岗双版本简历话术、面试 Q&A。触发词:评估项目、项目打分、简历包装、面试准备、怎么写进简历、项目评价、改进建议、对标大厂、通吃策略。 |
Project Evaluator — RAG/Agent 项目评估与求职辅导
输入: 当前工作目录的项目代码库
输出: 量化评分 + 改进路线图 + 简历话术 + 面试 Q&A
触发条件
用户提及以下任意内容时激活:
- 评估项目、项目打分、评价一下、对标大厂
- 怎么写进简历、简历包装、项目描述
- 面试准备、面试怎么讲、项目面试
- 改进建议、怎么提升、项目优化
- 算法岗怎么写、开发岗怎么写、通吃策略
评估 Pipeline(6 步)
Step 1: 扫描项目结构 → 判定 L1-L4 级别
Step 2: 读取关键文件 → 识别技术栈与核心能力
Step 3: 五维度评分 → 按 rubric 逐项打分
Step 4: 计算岗位适配分 → 算法岗 / 开发岗 / 通吃型
Step 5: 生成诊断报告 → 优势 + 短板 + 优先级排序
Step 6: 输出求职材料 → 简历话术 + 面试 Q&A + 路线图
Step 1: 项目结构扫描
扫描以下目录和文件,快速判定项目级别:
Get-ChildItem src,tests,docs,config,frontend -ErrorAction SilentlyContinue
Test-Path README.md, pyproject.toml, Dockerfile, .env.example, .github/workflows
(Get-ChildItem tests -Recurse -Filter test_*.py -ErrorAction SilentlyContinue).Count
| 特征组合 | 级别 |
|---|
| 无 src/,单文件脚本 | L1 玩具级 |
| 有 src/ 但无 tests/,无配置管理 | L2 课程级 |
| src/ + tests/ + 配置 + 前端 + Dockerfile | L3 生产级 |
| 以上全部 + 论文/Benchmark/消融实验 | L4 研究级 |
求职底线: 简历项目不得低于 L2;目标大厂至少一个 L3。
Step 2: 读取关键文件
按优先级读取(最多 5 个并行):
| 优先级 | 文件 | 评估维度 |
|---|
| P0 | README.md | 产品、文档 |
| P0 | 架构文档(如 PROJECT_ARCHITECTURE*.md) | 工程架构 |
| P0 | src/ 核心模块(3-5 个关键文件) | 工程、算法 |
| P1 | tests/ 测试结构 | 工程质量 |
| P1 | pyproject.toml / requirements.txt | 技术栈 |
| P1 | frontend/ 目录结构 | 产品完整度 |
| P2 | 评估脚本 (benchmark_*.py, *_eval*.py) | 可观测性 |
| P2 | .github/workflows/ | DevOps |
Step 3: 五维度评分
读取 references/evaluation_rubric.md 获取完整评分细则。此处仅保留评分框架:
| 维度 | 权重 | 核心检查点 |
|---|
| A 工程架构 | 30% | 架构分层、异步并发、容错降级、代码规范、测试覆盖 |
| B 算法深度 | 25% | 检索策略、查询优化、上下文管理、自研算法、模型训练 |
| C 产品完整度 | 20% | 功能覆盖、文件处理、前端交互、部署运维、多协议接入 |
| D 可观测性 | 15% | 自动化评估、检索指标、生成指标、消融实验、Trace/Dashboard |
| E 文档影响力 | 10% | 技术文档、求职文档、开源数据 |
每个子项按 1-5 分评分,换算为百分制。
关键加分信号:
- 工厂模式管理多 Provider → A+1
- 用户中断后状态回滚 → A+1
- 三层测试齐全 (Unit/Integration/E2E) → A+1
- 混合检索 + Rerank → B+1
- 查询重写/子查询拆分 → B+1
- 多级记忆架构 → B+1
- 会话级数据隔离 → C+1
- SSE 流式输出 + Citation → C+1
- MCP 协议支持 → C+1
- Golden Test Set (>50条) → D+1
- 消融实验 → D+1
- 双岗简历写法文档 → E+1
Step 4: 岗位适配计算
算法岗
总分 = A×0.20 + B×0.40 + C×0.15 + D×0.20 + E×0.05
| 总分 | 等级 | 求职建议 |
|---|
| 85-100 | S | 冲刺大厂核心算法岗 |
| 70-84 | A | 适合主流算法岗 |
| 55-69 | B | 可投,需补算法创新 |
| < 55 | C/D | 不建议作为核心项目 |
开发岗
总分 = A×0.40 + B×0.15 + C×0.25 + D×0.15 + E×0.05
| 总分 | 等级 | 求职建议 |
|---|
| 85-100 | S | 冲刺大厂高级开发/架构师 |
| 70-84 | A | 适合主流 RAG/Agent 开发岗 |
| 55-69 | B | 可投,需补业务指标和部署 |
| < 55 | C/D | 需要重大重构 |
通吃型
同时计算两个分数,取较高者为主投方向,另一方向为辅助项目。
Step 5: 诊断报告
按以下模板输出:
# 项目评估报告: [项目名]
## 一、项目分级
级别: L? [级别名]
判断依据: [一句话,如"具备完整端到端链路+异步处理+测试覆盖,但缺少算法创新"]
## 二、五维度评分
| 维度 | 原始分 | 权重 | 加权分 | 亮点 | 短板 |
|:---|:---:|:---:|:---:|:---|:---|
| A 工程架构 | X/30 | 30% | X | ... | ... |
| B 算法深度 | X/25 | 25% | X | ... | ... |
| C 产品完整度 | X/20 | 20% | X | ... | ... |
| D 可观测性 | X/15 | 15% | X | ... | ... |
| E 文档影响力 | X/10 | 10% | X | ... | ... |
| **总分** | **X/100** | - | **X** | - | - |
## 三、岗位适配
### 算法岗: XX 分 (X 级)
优势: ... 致命短板: ... 建议: ...
### 开发岗: XX 分 (X 级)
优势: ... 致命短板: ... 建议: ...
## 四、改进路线图
### P0(本周)
1. ...
2. ...
### P1(2周内)
1. ...
2. ...
### P2(1个月内)
1. ...
Step 6: 求职材料输出
6.1 简历话术
读取 references/resume_templates.md 获取模板。核心原则:
开发岗公式:
背景 → 技术栈 → 优化动作 → 量化成果
【XXX系统】
- 背景: [业务痛点,如"日均5000+重复工单"]
- 技术: [具体框架,如"LangGraph + Chroma + FastAPI + Vue3"]
- 优化: [工程动作,如"滑动窗口记忆压缩、混合检索RRF融合、并发信号量控制"]
- 成果: [量化数字,如"P99延迟2s→300ms,自动化率80%,节省200万/年"]
算法岗公式:
问题 → 方法 → 实验 → 产出
【XXX策略优化】
- 问题: [基线指标,如"传统RAG召回率仅65%"]
- 方法: [创新策略,如"基于ReAct的自主规划检索+多跳推理"]
- 实验: [对比数据,如"召回率提升至85%,消融:规划策略贡献12%,路径排序贡献8%"]
- 产出: [论文/开源,如"论文在投EMNLP,代码开源300+Stars"]
6.2 面试 Q&A
读取 references/interview_qa.md 获取高频问题库。每次评估至少准备 5 个高频问题:
- 创新点在哪里? → 指向评分中最高的维度
- 如果数据量扩大10倍怎么扩展? → 考察架构设计深度
- 出现过什么线上问题?怎么解决的? → 考察工程经验
- 为什么选择这个技术栈? → 考察技术判断力
- 怎么评估效果?指标是多少? → 考察数据思维
输出规则
- 客观评分: 严格按 rubric 检查点评分,不因为用户情绪虚高
- 量化优先: 所有评价必须有具体检查点支撑,避免模糊描述
- 岗位对齐: 明确区分算法岗和开发岗的不同要求
- 可执行: 改进建议必须具体到文件名、技术方案、预期耗时
- 求职导向: 最终输出必须包含可直接复制到简历的话术
常见项目类型速评
| 类型 | 典型得分 | 升级路径 |
|---|
| 基础 RAG Demo | 15-25 | 补测试 + 补前端 + 补评估 |
| LangChain 客服 Bot | 25-40 | 模块化重构 + 自研策略 + 指标 |
| 企业级知识库系统 | 65-85 | 加 GraphRAG + 微调 + 深度评估 |
| 顶会论文复现+工程化 | 75-90 | 补测试 + 补部署 + 补文档 |
References
- 评分细则:
references/evaluation_rubric.md — 五维度 1-5 分完整标准,Step 3 评分时读取
- 简历模板:
references/resume_templates.md — 算法岗/开发岗/通吃型简历话术模板,Step 6 输出时读取
- 面试题库:
references/interview_qa.md — 按岗位分类的面试高频问题与回答思路,Step 6 输出时读取