원클릭으로
ToAdapt
ToAdapt에는 koizachek에서 수집한 skills 16개가 있으며, 저장소 수준 직업 범위와 사이트 내 skill 상세 페이지를 제공합니다.
이 저장소의 skills
Katalog aller Env-Variablen (Backend + Frontend) und aller Magic Numbers im ToAdapt-Repo, plus TP_CONFIGS/TP_SCHEDULE-Anatomie und die Checkliste "Neue Config-Achse hinzufügen". Lade diese Skill, wenn du (a) eine Umgebungsvariable suchst, setzt, umbenennst oder ihre Wirkung verstehen musst (OPENROUTER_*, TOADAPT_API_KEY, STUDENT_ACCESS_CODE, PSEUDONYM_SECRET, RESEARCH_API_KEY, MONGODB_*, ALLOWED_ORIGINS, WEB_CONCURRENCY, TEACHER_*, NEXT_PUBLIC_API_URL), (b) ein hardcodiertes Limit/Schwellwert änderst (max_tokens, Punktbänder, Wortlimits, Rate-Limits, Timeouts, Feedback-Schwellen), (c) Symptome wie "401/503 auf Teacher-Endpoints", "Session-404 bei mehreren Workern", "Studenten-API öffentlich erreichbar", "Warnung student_flow_open", "falsche TP-Phase" debuggst, oder (d) eine neue Konfigurationsachse einführen willst. Keywords: env, .env, Environment Variable, Flag, Config, Magic Number, Schwellwert, Threshold, TP_CONFIGS, TP_SCHEDULE, Railway Variables, Vercel Environment.
Validierung und Qualitätssicherung im ToAdapt-Repo: Was als Evidenz für eine Änderung zählt (CI < Smoke < Guardrail-Regression < Teacher-Alignment), Landkarte aller pytest-Tests, das Golden-Case-Inventar (alpes-bank-genai-001 + Rubric-JSONs als kalibrierte Artefakte), Copy-Paste-Muster zum Ergänzen neuer Tests, CI-Anatomie inkl. PYTHONPATH-Falle, Akzeptanz-Schwellen. Lade diese Skill, wenn du: (a) vor einem Commit/Push wissen willst, welche Prüfungen Pflicht sind und wie man sie lokal ausführt; (b) einen neuen Test schreiben willst (TestClient, Mongo-Env wegräumen, LLM mocken, Stores auf tmp_path patchen); (c) den Judge/Evaluator/Prompts geändert hast und wissen musst, welcher Nachweis akzeptiert wird; (d) Tests fehlschlagen (z. B. ModuleNotFoundError backend, 2-Sekunden-Hänger, 90-Tests-Baseline verletzt); (e) den Golden Case oder eine Rubric-JSON anfassen willst; (f) fragst "reicht dieser Beweis?" oder "welcher Test deckt X ab?". Keywords: pytest, ruff, CI, ci.yml, TestClient, monkeypatch, Golden Case, Rubr
Domänen-Referenz für ToAdapt (BWL-A-Transfer-Trainer, Universität St.Gallen). Lade diese Skill, wenn du BWL-didaktische Begriffe im Code verstehen musst: Bloom-Taxonomie / bloom_level / Lernziel-Tags, Touchpoints (TP1–TP4), TP_CONFIGS, Constructive Alignment, Scaffolding vs. Answer-Giving, die vier Agenten (metacognitive/strategic/conceptual/procedural), Guardrails und Guardrail-Fallbacks, pfadoffene Rubrics, Business Model Canvas / canvas_alignment / rubric_fit / Exemplar, das Assessment-Modell (Individuum im Tool, Gruppen-Aggregate beim Tutor, group_code, Pseudonymisierung), formative Live-Unterstützung (Denkanstoß, Canvas-Abdeckung, Selbst-Check), warum "ON Running" und "NORDIC HOME" verboten sind, oder Projektjargon wie ÜGL, Matrikelnummer / Teilnehmer-ID, technical_fallback. Typische Symptome: "Was bedeutet dieses Feld im Rubric-JSON?", "Warum darf der Agent keinen Framework-Namen sagen?", "Wie wird canvas_alignment_pct berechnet?", "Was ist q4/Bloom 6?".
Lade diese Skill, BEVOR du in ToAdapt eine Architektur-Entscheidung triffst, hinterfragst oder versehentlich rückgängig machst. Trigger: du willst WebSockets/Streaming einführen; du fragst dich, wo Chat-History oder Session-State liegt; du willst einen neuen Store/eine neue Collection bauen; du änderst Auth (X-API-Key, Student-Access-Code, X-Research-Key, Teacher-Cookie mit Tutor-Kennung, Proxy); du änderst Guardrails oder wunderst dich, warum eine Agent-Antwort komplett ersetzt wurde; du fragst "warum ist das so gebaut?"; du suchst die Liste der Invarianten oder der bekannten offenen Schwachstellen (Keyword-Routing, TP4-Lücke, per-Worker-Rate-Limits). Enthält: Ist-Architektur-Diagramm, die 4 Auth-Pfade, 6 tragende Entscheidungen mit WARUM+Commit-Beleg, harte Invarianten, ehrliche Schwachstellenliste.
Entwicklungsumgebung für das ToAdapt-Repo (FastAPI-Backend + Next.js-Frontend) von Null aufbauen. Lade diese Skill, wenn du (a) das Repo frisch geklont hast und Backend/Frontend zum Laufen bringen willst, (b) Symptome wie "ModuleNotFoundError: No module named 'backend'" bei pytest, "mongo_logger_unavailable" im Log, fehlende pytest/pytest-asyncio-Pakete oder eine leere/fehlende .env siehst, (c) wissen willst, welche Python-/Node-Version gilt, wie docker-compose lokal Mongo bereitstellt oder warum load_dotenv VOR den Imports stehen muss (E402-Ignores), oder (d) prüfen willst, ob die Umgebung "steht" (Tests grün, uvicorn bootet, /health antwortet). Keywords: setup, install, venv, pip, requirements.txt, npm ci, .env, .env.local, docker-compose, pytest, tsc, ruff, mypy, Python 3.11, Node 22.
Lade diese Skill, BEVOR du in ToAdapt irgendetwas änderst, committest, pushst oder deployst. Sie klassifiziert jede Änderung (studierendensichtbares Verhalten, Judge/Scoring, Infra/Deploy, Forschungs-Skripte) und nennt das jeweils verpflichtende Gate. Sie enthält die unverhandelbaren Regeln des Projekts mit Rationale und dem historischen Vorfall dahinter. Trigger: "darf ich das ändern?", Prompt-/Guardrail-/Evaluator-Änderung, Case-Freigabe, force/override, Commit-Message schreiben, git push, Deploy auf Railway/Vercel, Env-Variable scharf schalten, PII/Teilnehmerdaten, Auth-Änderung, Wortlimits, "quick fix auf main", --force push, Rebase/History-Umschreiben.
Symptom-zu-Ursache-Triage für die realen Failure-Modes des ToAdapt-Backends (FastAPI auf Railway) und -Frontends (Next.js auf Vercel). Lade diese Skill, wenn eines dieser Symptome auftritt: Deploy sieht Env-Variablen nicht / Konfiguration wirkt "leer"; MongoDB verbindet nicht oder Daten verschwinden nach Redeploy; HTTP 401 oder 503 auf Admin-/Dashboard-/Studenten-Endpunkten; HTTP 429 "Zu viele Anfragen"; Chat antwortet mit 404 "Session nicht gefunden"; der LLM-Judge liefert 0 Punkte mit evaluation_status "technical_fallback"; Submit schlägt komplett mit 503 fehl; 401 auf /dashboard/students trotz korrektem Tutor-Key (X-Research-Key nötig); 429 "Denkanstoß-Limit erreicht"; Agent-Antworten werden scheinbar grundlos durch generische Fallback-Texte ersetzt (guardrail_triggered); CORS-Fehler im Browser; oder jemand will WebSockets (wieder) einführen. Schlüsselwörter: debugging, triage, 401, 503, 429, 404, CORS, Mongo, Railway, Nixpacks, dotenv, guardrail, technical_fallback, rate limit, WEB_CONCURRENCY, X-Research
MESSEN statt schätzen im ToAdapt-Repo. Lade diese Skill, wenn du den Zustand einer laufenden Backend-Instanz prüfen willst (GET /health vs. GET /health/diagnostics mit X-API-Key), ein Log-Event interpretieren musst (toadapt_startup, student_flow_open, pseudonymization_disabled, llm_call_completed, guardrail_triggered, formative_feedback_guardrail_triggered, chat_error, evaluation_json_parse_failed, mongo_*_failed, case_saved …), Railway-Logs nach Ereignissen filtern willst, Fragen über die Mongo-Collection experiment_events beantworten sollst ("wie viele Guardrail-Trigger pro Tag?", "Ø Turns pro Session?", "Agent-Verteilung?"), Token-Kosten kontrollieren willst, oder einen Smoke-Test gegen lokal/Railway fahren möchtest. Enthält drei getestete Skripte unter scripts/: smoke_backend.sh, summarize_dashboard_results.py, analyze_experiment_events.py.
Chronik aller geschlagenen Schlachten im ToAdapt-Repo (2026-04-06 bis 2026-07-08): Symptom → Root Cause → Beleg-Commit → Status. Lade diese Skill, wenn du (a) verstehen willst, WARUM der Code so aussieht wie er aussieht (toter websocket_url, BUILD_MARKER, doppelte Commits, load_dotenv vor den Imports), (b) eine Änderung planst, die eine alte Wunde berühren könnte (WebSockets, CORS, Anthropic-SDK, dotenv/Nixpacks, Mongo-Env, Judge-JSON, Git-History), (c) auf CLAUDE.md oder dev-docs/ stößt und sie für aktuelle Doku hältst, (d) Fragen zu PII-Vorfall, git filter-repo, Force-Push, duplizierten Juni-Commits oder dem Branch security-hardening hast, oder (e) wissen willst, welche Dateien historisch am meisten Churn hatten und warum. Schlüsselwörter: git history, Commit-Archäologie, Regression, "warum ist das so", Pivot, Fossil, Railway-Kapitulation, History-Rewrite.
Betriebs-Runbook für ToAdapt: lokal starten (uvicorn-Backend, Next.js-Frontend, docker compose), Smoke-Test per curl (health, /auth/student/verify, Teacher-Login), Deploy-Anatomie Railway (Nixpacks, railway.toml) + Vercel, Scharf-Schalten-Checkliste für Produktion (Env-Reihenfolge, WEB_CONCURRENCY), wo Daten landen (Mongo-Collections vs. Datei-Fallbacks, ephemeres Railway-FS), Bedienung der Forschungs-Pipeline-Skripte in scripts/ (import → export → compare → retry → publish) plus Tutor-Code-Generator und Secrets-Ablage (inkl. PSEUDONYM_SECRET, RESEARCH_API_KEY, TEACHER_ACCESS_CODES). Lade diese Skill bei Aufgaben wie: "starte das System lokal", "deploye", "geht der Server?", "wo liegen die Submissions?", "Daten nach Redeploy weg", "Review-Workbooks exportieren", "Prolific-Daten importieren", "Teacher-Alignment-Vergleich rechnen", "welches Secret gehört wohin?", "STUDENT_ACCESS_CODE scharf schalten", "Tutor-Codes generieren".
Lade diese Skill, BEVOR du im ToAdapt-Repo Dokumentation liest, schreibst oder aktualisierst. Sie sagt dir, welchem Dokument du glauben darfst (ROLLOUT_CHECKLIST.md = operativer Gate-Workflow, ROLLOUT_PLAN.md = Hintergrund-Wahrheit; CLAUDE.md, TODO.md, dev-docs/ = Fossile; README.md = Einstieg mit bekannten Fehlern), wie Forschungs-Reports und Pipeline-Artefakte benannt werden (teacher_alignment_report_*, review_item_id, UTC-Timestamps), und welchen Haus-Stil das Projekt hat (Deutsch primär, Commit-Messages ohne AI-Attribution, DE/EN-Sprachobjekte synchron halten). Trigger: "ist CLAUDE.md aktuell?", "wo steht der Projektstatus?", "README stimmt nicht mit dem Code überein", "wie benenne ich diesen Report?", "Commit-Message schreiben", "Doku nach meiner Änderung aktualisieren", "neuen UI-Text hinzufügen", "Skill-Library pflegen", Widersprüche zwischen Doku und Code, Statusblock im Rollout-Plan, i18n / Übersetzung / Locale.
Knowledge Tracing und langfristige Kompetenzentwicklung der Lernenden in ToAdapt. Lade diese Skill, wenn du (a) Lernverläufe über Zeit auswerten willst ("wird Studierende:r X in 'wirkungskette' besser?", Lernkurven, Mastery, Kompetenzentwicklung über TP1–TP4), (b) wissen musst, welche Längsschnitt-Datenbasis existiert (Pseudonym-Stabilität, learning_objective_tags, Bloom-Stufen, Zeitstempel) und welche NICHT, (c) ein Mastery-Modell (BKT/EWMA/Lernkurven) für dieses Repo bauen oder bewerten sollst, (d) adaptive Scaffolding-Intensität auf Basis von Lernstand planst, oder (e) das mitgelieferte Trajektorien-Skript nutzen willst. Keywords - Knowledge Tracing, BKT, Mastery, Lernkurve, longitudinal, Skill Development, Kompetenz, Trajektorie, EWMA, learning_objective_tags, Verlauf, Fortschritt.
First-Principles-Analysemethoden für ToAdapt, jeweils als Rezept mit durchgerechnetem Beispiel aus der Repo-Geschichte. Lade diese Skill, wenn du (a) eine Judge-vs.-Teacher-Vergleichsstudie designen oder auswerten willst (Blind-Review, review_item_id-Join, Scope-Regeln), (b) Alignment-Metriken interpretieren musst (Pearson r vs. MAE/RMSE vs. Mean Diff, within_2pt, Kleine-n-Ehrlichkeit bei n=16), (c) LLM-Kosten oder Token-Verbrauch abschätzen willst (llm_call_completed-Logs aggregieren), (d) eine Prompt-Änderung gegen die Guardrail-Pattern prüfen willst BEVOR sie live geht, (e) eine Hypothese sauber in Vorhersage und Messung übersetzen willst, oder (f) wissen musst, welcher Beweis-Typ für welche Behauptung NICHT reicht. Keywords: Pearson, MAE, RMSE, Bias, Kalibrierung, Korrelation, Blind Review, Workbook, Anker-Bias, Token, Kosten, prompt_tokens, guardrail_check, Regression, Hypothese, Vorhersage, Konfidenzintervall, in-sample, n=16.
Offene Forschungsprobleme des ToAdapt-Projekts, bei denen dieses Repo einen Beitrag jenseits des aktuellen Stands der Technik leisten kann. Lade diese Skill, wenn du (a) ein Forschungsthema, Paper-Thema oder eine Studie auf Basis dieses Repos suchst ("was ist hier publizierbar?", "wo ist die Forschungslücke?", "research agenda", "CompEd-Nachfolge"), (b) eines der fünf Frontier-Probleme bearbeiten willst: Bloom-6/q4-Judge-Alignment, gruppen-bewusste Tutor-Insights, Scaffolding-Wirksamkeitsnachweis, adaptive Scaffolding-Intensität, Qualitäts-Autoevaluation generierter Cases, oder (c) wissen willst, welches Projekt-Asset (Daten, Pipeline, Logging) ein Forschungsvorhaben trägt und was der erste konkrete Schritt im Repo ist. Keywords: Forschung, Publikation, SOTA, LLM-as-Judge, Bloom 6, Alignment, Learning Analytics, Scaffolding-Effekt, experiment_events, Frontier.
Forschungs-Disziplin des ToAdapt-Projekts: Wie aus einer Ahnung ein akzeptiertes, publizierbares Ergebnis wird. Lade diese Skill, wenn du (a) eine Verbesserungs-Idee für Judge/Evaluator/Prompts/Scaffolding testen oder bewerten willst ("bringt X etwas?", "sollen wir Y ändern?"), (b) ein Experiment oder eine Messung planst (Hypothese, Metriken, Erfolgs-/Abbruchkriterien), (c) Ergebnisse berichten willst (Report, Paper-Abschnitt, Statusmeldung an die Ownerin) und wissen musst, welche Behauptungen zulässig sind und welche nicht, (d) fragst, ob eine Metrik-Verbesserung "echt" ist oder durch Auslassung lügt (Pearson r vs. Mean Diff), (e) Reproduzierbarkeit sichern musst (SHA-256-Manifeste, eingefrorene Scopes, Datenablage), oder (f) eine gescheiterte Idee sauber beerdigen willst. Keywords: Hypothese, Experiment, Evidenz, Evidenz-Bar, Alignment-Studie, Blind-Review, Pearson, MAE, Mean Diff, Kalibrierung, Publikation, Claim, Reproduzierbarkeit, Manifest, DSGVO, Prolific, Retirement, Sackgasse.
Pädagogische Qualitätsbewertung der LLM-Tutor-Antworten in ToAdapt nach der NAACL-2025-Taxonomie (Maurya et al., "Unifying AI Tutor Evaluation") - acht Dimensionen, LLM-as-Judge, Human-Validierung, Desirability-Quoten. Lade diese Skill, wenn du (a) messen willst, wie gut die Chat-Agenten oder Denkanstöße pädagogisch antworten ("verrät der Agent Lösungen?", "sind Antworten actionable?"), (b) scripts/evaluate_tutor_responses.py bedienen willst (Erhebung, Annotation-Workbook, Aggregation), (c) einen Agent-/Formative-Prompt geändert hast und den Pflicht-Regressionsnachweis brauchst, (d) ein TUTOR-Modell auswählen oder wechseln willst (OPENROUTER_MODEL) und Kandidaten vergleichen musst, oder (e) die Judge-Verlässlichkeit gegen menschliche Annotation validieren willst. Keywords - Tutor-Evaluation, NAACL, MRBench, Mistake Identification, Revealing of the Answer, Providing Guidance, Actionability, Tutor Tone, Humanlikeness, Desirability, Pedagogical Ability, LLM-as-Judge, Modellwahl.