feat: Erweitere Skill-Beschreibungen mit präziseren Nutzungsrichtlinien

- Verfeinere Description-Felder aller Skills für besseres Triggering
- Neue skill-creator@claude-plugins-official Permission
- /story mit neuer Reference-Struktur (phase-spezifische Detail-Dateien)
- /go, /plan-review, /ship, /workflow-review: klarere Abgrenzungen
- Vereinfachung im Vergleich zu vorigen Versionen

Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
This commit is contained in:
2026-04-19 15:44:52 +02:00
co-authored by Claude Sonnet 4.6
parent 6f9079fa5f
commit 2fbb59852e
26 changed files with 1035 additions and 54 deletions
@@ -0,0 +1,82 @@
[
{
"query": "bitte reviewe meinen plan bevor ich anfange zu implementieren",
"should_trigger": true
},
{
"query": "ich hab den plan fertig, kann ein unabhängiger agent drüber schauen?",
"should_trigger": true
},
{
"query": "plan review bitte",
"should_trigger": true
},
{
"query": "prüfe ob der plan vollständig ist — akzeptanzkriterien, tests, migrations",
"should_trigger": true
},
{
"query": "der plan steht, bitte einen zweiten blick drauf werfen auf risiken und fehlende tests",
"should_trigger": true
},
{
"query": "kannst du mit opus meinen plan prüfen lassen? ich bin nicht sicher ob die alembic-migrationen alle eingeplant sind",
"should_trigger": true
},
{
"query": "/plan-review",
"should_trigger": true
},
{
"query": "ich will sicher gehen dass mein implementierungsplan alle akzeptanzkriterien abdeckt bevor wir loslegen",
"should_trigger": true
},
{
"query": "erkläre mir wie ich einen guten implementierungsplan schreibe",
"should_trigger": false
},
{
"query": "reviewe den code in auth_service.py auf security-probleme",
"should_trigger": false
},
{
"query": "was ist der aktuelle status des projekts?",
"should_trigger": false
},
{
"query": "schreib mir einen implementierungsplan für das login-feature",
"should_trigger": false
},
{
"query": "kannst du die PR-beschreibung reviewen?",
"should_trigger": false
},
{
"query": "ich möchte den workflow reviewen auf best practices",
"should_trigger": false
},
{
"query": "bitte die testabdeckung prüfen",
"should_trigger": false
},
{
"query": "ist mein datenbankschema für user und teams gut designed?",
"should_trigger": false
},
{
"query": "security audit für die aktuellen änderungen bitte",
"should_trigger": false
},
{
"query": "reviewe die PR #23",
"should_trigger": false
},
{
"query": "checke ob meine FastAPI-endpoints die richtigen HTTP-statuscodes zurückgeben",
"should_trigger": false
},
{
"query": "kannst du den plan weiterentwickeln? ich glaube phase 3 fehlt noch",
"should_trigger": false
}
]
@@ -0,0 +1,22 @@
[
{"query": "bitte reviewe meinen plan bevor ich anfange zu implementieren", "should_trigger": true},
{"query": "ich hab den plan fertig, kann ein unabhängiger agent drüber schauen?", "should_trigger": true},
{"query": "plan review bitte", "should_trigger": true},
{"query": "prüfe ob der plan vollständig ist — akzeptanzkriterien, tests, migrations", "should_trigger": true},
{"query": "der plan steht, bitte einen zweiten blick drauf werfen auf risiken und fehlende tests", "should_trigger": true},
{"query": "kannst du mit opus meinen plan prüfen lassen? ich bin nicht sicher ob die alembic-migrationen alle eingeplant sind", "should_trigger": true},
{"query": "/plan-review", "should_trigger": true},
{"query": "ich will sicher gehen dass mein implementierungsplan alle akzeptanzkriterien abdeckt bevor wir loslegen", "should_trigger": true},
{"query": "erkläre mir wie ich einen guten implementierungsplan schreibe", "should_trigger": false},
{"query": "reviewe den code in auth_service.py auf security-probleme", "should_trigger": false},
{"query": "was ist der aktuelle status des projekts?", "should_trigger": false},
{"query": "schreib mir einen implementierungsplan für das login-feature", "should_trigger": false},
{"query": "kannst du die PR-beschreibung reviewen?", "should_trigger": false},
{"query": "ich möchte den workflow reviewen auf best practices", "should_trigger": false},
{"query": "bitte die testabdeckung prüfen", "should_trigger": false},
{"query": "ist mein datenbankschema für user und teams gut designed?", "should_trigger": false},
{"query": "security audit für die aktuellen änderungen bitte", "should_trigger": false},
{"query": "reviewe die PR #23", "should_trigger": false},
{"query": "checke ob meine FastAPI-endpoints die richtigen HTTP-statuscodes zurückgeben", "should_trigger": false},
{"query": "kannst du den plan weiterentwickeln? ich glaube phase 3 fehlt noch", "should_trigger": false}
]
@@ -0,0 +1,81 @@
Split: 13 train, 7 test (holdout=0.4)
============================================================
Iteration 1/5
Description: Startet einen unabhängigen Opus-Agenten der den aktuellen Plan auf Vollständigkeit, Risiken und fehlende Tests prüft. Aktivieren nach der Planungsphase, bevor die Implementierung beginnt.
============================================================
Train: 24/39 correct, precision=100% recall=0% accuracy=62% (49.9s)
[FAIL] rate=0/3 expected=True: kannst du mit opus meinen plan prüfen lassen? ich bin nicht
[FAIL] rate=0/3 expected=True: ich will sicher gehen dass mein implementierungsplan alle ak
[FAIL] rate=0/3 expected=True: plan review bitte
[FAIL] rate=0/3 expected=True: bitte reviewe meinen plan bevor ich anfange zu implementiere
[FAIL] rate=0/3 expected=True: ich hab den plan fertig, kann ein unabhängiger agent drüber
[PASS] rate=0/3 expected=False: ich möchte den workflow reviewen auf best practices
[PASS] rate=0/3 expected=False: ist mein datenbankschema für user und teams gut designed?
[PASS] rate=0/3 expected=False: bitte die testabdeckung prüfen
[PASS] rate=0/3 expected=False: erkläre mir wie ich einen guten implementierungsplan schreib
[PASS] rate=0/3 expected=False: checke ob meine FastAPI-endpoints die richtigen HTTP-statusc
[PASS] rate=0/3 expected=False: security audit für die aktuellen änderungen bitte
[PASS] rate=0/3 expected=False: reviewe den code in auth_service.py auf security-probleme
[PASS] rate=0/3 expected=False: kannst du den plan weiterentwickeln? ich glaube phase 3 fehl
Test : 12/21 correct, precision=100% recall=0% accuracy=57% (0.0s)
[FAIL] rate=0/3 expected=True: prüfe ob der plan vollständig ist — akzeptanzkriterien, test
[FAIL] rate=0/3 expected=True: der plan steht, bitte einen zweiten blick drauf werfen auf r
[FAIL] rate=0/3 expected=True: /plan-review
[PASS] rate=0/3 expected=False: schreib mir einen implementierungsplan für das login-feature
[PASS] rate=0/3 expected=False: was ist der aktuelle status des projekts?
[PASS] rate=0/3 expected=False: kannst du die PR-beschreibung reviewen?
[PASS] rate=0/3 expected=False: reviewe die PR #23
Improving description...
Traceback (most recent call last):
File "<frozen runpy>", line 198, in _run_module_as_main
File "<frozen runpy>", line 88, in _run_code
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 332, in <module>
main()
~~~~^^
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 297, in main
output = run_loop(
eval_set=eval_set,
...<11 lines>...
log_dir=log_dir,
)
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 202, in run_loop
new_description = improve_description(
client=client,
...<7 lines>...
iteration=iteration,
)
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/improve_description.py", line 114, in improve_description
response = client.messages.create(
model=model,
...<5 lines>...
messages=[{"role": "user", "content": prompt}],
)
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_utils/_utils.py", line 283, in wrapper
return func(*args, **kwargs)
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/resources/messages/messages.py", line 1000, in create
return self._post(
~~~~~~~~~~^
"/v1/messages",
^^^^^^^^^^^^^^^
...<30 lines>...
stream_cls=Stream[RawMessageStreamEvent],
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
)
^
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 1368, in post
return cast(ResponseT, self.request(cast_to, opts, stream=stream, stream_cls=stream_cls))
~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 1062, in request
request = self._build_request(options, retries_taken=retries_taken)
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 521, in _build_request
headers = self._build_headers(options, retries_taken=retries_taken)
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 451, in _build_headers
self._validate_headers(headers_dict, custom_headers)
~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_client.py", line 196, in _validate_headers
raise TypeError(
'"Could not resolve authentication method. Expected either api_key or auth_token to be set. Or for one of the `X-Api-Key` or `Authorization` headers to be explicitly omitted"'
)
TypeError: "Could not resolve authentication method. Expected either api_key or auth_token to be set. Or for one of the `X-Api-Key` or `Authorization` headers to be explicitly omitted"