con un clic
easy_vllm_simulator
easy_vllm_simulator contiene 5 skills recopiladas de tbvjvsladla, con cobertura ocupacional por repositorio y páginas de detalle dentro del sitio.
Skills en este repositorio
실행 중인 vLLM serve 의 성능을 *적대적으로* 검증해 "기대 이하"를 게이트에서 차단한다. 결정론 루프라인 (R_fp/R_token, spec-aware) + 외부 레퍼런스(E) + 사용자(c) 3중 루브릭으로 무장한 Devil's Advocate 가 "이 서빙은 충분히 빠르다"는 주장을 공격 → 기각 시 recipe-explorer 를 자극해 전략 폐기·재탐색 (loop-until-done). "서빙 성능 검증해줘", "벤치마크 돌려줘", "이 모델 너무 느린데", "디코드 속도 정상이야?", "기대 이하 성능 검증", "성능 게이트" 같은 지시에 발동. 측정=`vllm bench serve`(결정론), 적대 판정=LLM. 실서빙을 기동하지 않는다(돌고 있는 serve 를 검증 — 기동은 recipe-explorer/compose). 근거: 적대적 검증 패턴(Pattern 3) + 목표달성까지 반복(Pattern 6) · plan_2026063014_1 · self-preference 사건 testlog_2026063004_1.
vLLM 업스트림 신버전을 추적해 변경을 독해하고, 커스텀 Docker 컨테이너 레이어(베이스 이미지· 핵심 wheel·주변 의존성)의 bump를 제안한다. "vllm 업데이트", "vllm 버전 올려", "신규 vllm 버전 반영", "컨테이너 버전 bump", "NGC 베이스 맞춰줘" 같은 지시에 발동. 제안만 하며, 실제 핀 변경· 빌드·push는 .claude/rules/workflow.md 의 전파 워크플로(HITL 게이트)를 따른다.
**토폴로지-중립 진입(온보딩) 오케스트레이터** — fresh-clone/미테라포밍 환경에서 능동 발동해 **첫 동작으로 토폴로지(① 단일노드 ② N대 멀티노드)를 인터뷰로 확정**하고, 그에 따라 노드를 스캔·manifest.yaml(스킬 간 단일 계약)을 채운다. **single → 단일노드 온보딩**(manifest nodes:[], sub-control dormant) · **multi → 서브노드 스캔·연결/성능 검증 + 서브 코드에이전트(Claude Code) 작업환경 구축**(메인 렌더→전달→model-less 카나리). "이제 뭐해야해", "환경 셋업", "온보딩", "테라포밍", "노드 스캔", "단일/멀티 결정", "manifest 생성", "서브노드 셋업", "인터커넥트 점검", "서브 에이전트 환경 구축", "서브 코드에이전트 셋업" 같은 지시·fresh-clone 감지에 발동. **무단 스캔 금지** — 토폴로지 인터뷰 → (multi면 5-전제조건 인터뷰) → 사용자 승인 후 스캔. 토폴로지 미선언 시 emit fail-closed. 성능 미검증 멀티 진행은 fail-closed로 차단.
모델획득 격리 환경(외부접속 전반 차단 아님)에서 고정된 한 모델의 config.json을 결정론적으로 파싱하고, (quantization × max-model-len × gpu-memory-utilization) 3축 레시피 후보를 결정론 VRAM 추정 → 예산×안전마진 하드게이트 → headroom→context 랭킹으로 제시하고, 사람이 고른 레시피를 DGX Spark 서빙용 3종 세트(.yaml+.sh+.env)로 생성한다(Phase 1, 추정). Phase 2는 멀티턴 인터뷰로 lock/soft/free 변수를 정하고 실서빙 trial-loop로 절대 KV 클램프(--kv-cache-memory-bytes)를 수렴시켜 검증된 레시피를 낸다. "레시피 추천", "서빙 레시피", "VRAM 예산에 맞춰", "이 모델 어떤 설정으로 띄울까", "RTX4090 예산 레시피", "gpu memory 예산", "recipe", "실제로 띄워서 검증", "KV 캐시 튜닝", "batch/동시요청", "tool/reasoning 파서", "attention backend" 같은 지시에 발동. tp는 manifest(len(nodes)×gpus_per_node) 자동결정(git 브랜치 ✗). 테라포밍-완수 Flag 없으면 info-only.
Path-reference librarian over the project's docs/ work-history (devlog, testlog, plan, simlog) and the sub-doc mirror. Builds a deterministic relationship graph (cites/realizes/evidences edges) and surfaces authority-ranked, edge-traversable context WITHOUT copying source bodies. Use when starting an Ouroboros interview, writing a plan, devising a model serving strategy, bumping a vLLM version, or adapting topology — whenever grounded prior context or faster Seed convergence helps; also when shelving new docs into the library or asking "what does this project already know about X". Also triggers on Korean instructions like "위키 조회", "이전에 뭐 했는지/뭐였지", "근거 문서 찾아줘", "관련 plan/devlog 찾아줘", "문서 등록/갱신/입고". Run init once to bootstrap __llm-wiki, then warm-start incrementally on each invocation.