| name | ocena-outputu-pl |
| description | Ocenia jakość outputu prawnego AI przed wysyłką w dwóch warstwach: obiektywnej (sprawdzalne mechanicznie - czy cytaty istnieją, czy przepisy i sygnatury realne) oraz subiektywnej (LLM-as-judge wg rubryki 1-5: poprawność prawna, kompletność, jasność, zgodność z jurysdykcją, ugruntowanie/anty-halucynacja). Zwraca kartę ocen i decyzję: wyślij / popraw / pełna weryfikacja. Warstwa nad deliverable - nie pisze pisma, ocenia gotowe. Pairuje z legal-request-router-pl (routing), citation-grounding-pl (obiektywne sprawdzenie), deliverable-fidelity-pl (czy nic nie wypadlo) i adversarial-legal-review-pl (atak). Uzywaj gdy: "oceń ten output", "scoring opinii", "czy to gotowe do wysyłki", "jakość odpowiedzi prawnej", "karta ocen deliverable", "rubryka jakości", przed wysłaniem pisma/opinii/memo do klienta.
|
| license | Apache-2.0 |
| allowed-tools | ["Read"] |
| data-residency | local |
| requires-human-approval | false |
| pii-egress | none |
| attribution | {"source":"FudanDISC/DISC-LawLLM (Fudan DISC Lab)","url":"https://github.com/FudanDISC/DISC-LawLLM","license":"Apache-2.0","relationship":"clean-room","note":"Metoda dwuwarstwowa (obiektywne dopasowanie plus subiektywna rubryka LLM-as-judge, skala 1-5) oparta na DISC-Law-Eval. Chińskie dane egzaminacyjne i model-sędzia porzucone; rubryka, wymiary i kotwice PL napisane od zera.\n"} |
| metadata | {"author":"Wiesław Mazur / MateMatic","version":"1.1.0","companion_skills":"legal-request-router-pl, citation-grounding-pl, deliverable-fidelity-pl, adversarial-legal-review-pl"} |
Ocena outputu PL - karta ocen przed wysyłką
Filozofia
Zanim wyślesz, oceń - i oddziel to, co sprawdzalne, od tego, co trzeba osądzić. Output AI bywa
gładki i przekonujący, a mimo to błędny. Ten skill ocenia go w dwóch warstwach: obiektywnej
(fakty, które da się sprawdzić mechanicznie) i subiektywnej (jakość, którą trzeba osądzić wg jawnej
rubryki). Dwie warstwy, bo mylenie ich to źródło fałszywej pewności - „brzmi dobrze" nie znaczy
„cytaty się zgadzają".
Skill ocenia, nie poprawia i nie wysyła. Decyzję podejmuje prawnik; karta ocen daje podstawę.
Warstwa 1 - obiektywna (sprawdzalne mechanicznie)
Deleguj do narzędzi, nie zgaduj:
- Cytaty i przepisy - czy istnieją w źródle słowo w słowo (citation-grounding-pl), czy wszystkie
wyłapane (ekstraktor-cytatow-pl).
- Sygnatury / ELI - czy realne i poprawnie zapisane.
- Kompletność ustaleń - czy żadna flaga RED nie wypadła z podsumowania (deliverable-fidelity-pl).
Wynik obiektywny jest binarny per pozycja: zgadza się / nie zgadza. Choćby jeden niezgodny cytat =
output nie jest gotowy, niezależnie od oceny subiektywnej.
Warstwa 2 - subiektywna (rubryka 1-5, LLM-as-judge)
Oceń wg jawnej rubryki, każdy wymiar 1-5 z jednozdaniowym uzasadnieniem:
| Wymiar | 1 | 5 |
|---|
| Poprawność prawna | teza błędna lub nieoparta | teza trafna i oparta na normie |
| Kompletność | pomija istotne kwestie | obejmuje wszystko, co istotne dla pytania |
| Jasność | mętne, niespójne | precyzyjne, czytelne dla odbiorcy |
| Zgodność z jurysdykcją | myli porządki/przepisy | trafne dla prawa polskiego/UE |
| Ugruntowanie (anty-halucynacja) | twierdzenia bez podstawy | każde twierdzenie ma oparcie |
NIEPEWNE zamiast liczby - ocena pierwszej klasy
Gdy sędzia nie ma podstaw, by wystawić liczbę, NIE wystawia jej. Zamiast wymuszonej trójki
wpisuje NIEPEWNE z podkategorią i wskazaniem, jakiego dowodu brakuje:
- NIEWYSTARCZAJĄCY_DOWÓD - oceny nie da się wystawić bez materiału, którego nie ma
w sesji (np. brak tekstu źródłowego wyroku II CSK NN/RR, brak umowy, do której output
się odwołuje). Wpisz, CZEGO brakuje i skąd to wziąć.
- DOKUMENT_NIEJEDNOZNACZNY - materiał jest, ale nie rozstrzyga (dwuznaczna klauzula,
sprzeczne fragmenty, pytanie klienta dopuszcza dwie wykładnie). Wpisz, NA CZYM polega
niejednoznaczność.