- Verfeinere Description-Felder aller Skills für besseres Triggering - Neue skill-creator@claude-plugins-official Permission - /story mit neuer Reference-Struktur (phase-spezifische Detail-Dateien) - /go, /plan-review, /ship, /workflow-review: klarere Abgrenzungen - Vereinfachung im Vergleich zu vorigen Versionen Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com>
82 lines
5.1 KiB
Plaintext
82 lines
5.1 KiB
Plaintext
Split: 13 train, 7 test (holdout=0.4)
|
|
|
|
============================================================
|
|
Iteration 1/5
|
|
Description: Reviewt Skills, Agenten und Konfigurationsdateien dieses Repos auf Vollständigkeit, Konsistenz und Best Practices. Erstellt einen umsetzbaren Plan für Verbesserungen.
|
|
============================================================
|
|
Train: 24/39 correct, precision=100% recall=0% accuracy=62% (48.5s)
|
|
[FAIL] rate=0/3 expected=True: bitte prüfe alle skills und agenten auf konsistenz
|
|
[FAIL] rate=0/3 expected=True: schau mal über die workflow-konfiguration, besonders den /sh
|
|
[FAIL] rate=0/3 expected=True: reviewe den aktuellen workflow und sag mir was verbessert we
|
|
[FAIL] rate=0/3 expected=True: vergleiche unsere skills mit der externen best-practice-refe
|
|
[FAIL] rate=0/3 expected=True: sind die skills noch up to date?
|
|
[PASS] rate=0/3 expected=False: was bedeutet das feld context: fork in einem skill?
|
|
[PASS] rate=0/3 expected=False: wie wird der test-runner agent gestartet?
|
|
[PASS] rate=0/3 expected=False: reviewe meinen code in orders_service.py auf qualität
|
|
[PASS] rate=0/3 expected=False: bitte den security-audit für die neuen endpoints durchführen
|
|
[PASS] rate=0/3 expected=False: zeig mir alle hooks die aktuell konfiguriert sind
|
|
[PASS] rate=0/3 expected=False: kannst du das CLAUDE.md reviewen und verbessern?
|
|
[PASS] rate=0/3 expected=False: bitte den offenen PR #15 reviewen
|
|
[PASS] rate=0/3 expected=False: was sind die unterschiede zwischen /go und /ship?
|
|
Test : 12/21 correct, precision=100% recall=0% accuracy=57% (0.0s)
|
|
[FAIL] rate=0/3 expected=True: ich möchte wissen ob meine claude-konfiguration best practic
|
|
[FAIL] rate=0/3 expected=True: gibt es widersprüche zwischen den skills in diesem repo?
|
|
[FAIL] rate=0/3 expected=True: workflow review bitte
|
|
[PASS] rate=0/3 expected=False: erstelle einen neuen skill für automatisches changelog-schre
|
|
[PASS] rate=0/3 expected=False: wie funktioniert der story-lifecycle?
|
|
[PASS] rate=0/3 expected=False: prüfe meinen implementierungsplan
|
|
[PASS] rate=0/3 expected=False: check mal ob settings.json korrekt ist
|
|
|
|
Improving description...
|
|
Traceback (most recent call last):
|
|
File "<frozen runpy>", line 198, in _run_module_as_main
|
|
File "<frozen runpy>", line 88, in _run_code
|
|
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 332, in <module>
|
|
main()
|
|
~~~~^^
|
|
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 297, in main
|
|
output = run_loop(
|
|
eval_set=eval_set,
|
|
...<11 lines>...
|
|
log_dir=log_dir,
|
|
)
|
|
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/run_loop.py", line 202, in run_loop
|
|
new_description = improve_description(
|
|
client=client,
|
|
...<7 lines>...
|
|
iteration=iteration,
|
|
)
|
|
File "/home/martin/.claude/plugins/cache/claude-plugins-official/skill-creator/unknown/skills/skill-creator/scripts/improve_description.py", line 114, in improve_description
|
|
response = client.messages.create(
|
|
model=model,
|
|
...<5 lines>...
|
|
messages=[{"role": "user", "content": prompt}],
|
|
)
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_utils/_utils.py", line 283, in wrapper
|
|
return func(*args, **kwargs)
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/resources/messages/messages.py", line 1000, in create
|
|
return self._post(
|
|
~~~~~~~~~~^
|
|
"/v1/messages",
|
|
^^^^^^^^^^^^^^^
|
|
...<30 lines>...
|
|
stream_cls=Stream[RawMessageStreamEvent],
|
|
^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
|
|
)
|
|
^
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 1368, in post
|
|
return cast(ResponseT, self.request(cast_to, opts, stream=stream, stream_cls=stream_cls))
|
|
~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 1062, in request
|
|
request = self._build_request(options, retries_taken=retries_taken)
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 521, in _build_request
|
|
headers = self._build_headers(options, retries_taken=retries_taken)
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_base_client.py", line 451, in _build_headers
|
|
self._validate_headers(headers_dict, custom_headers)
|
|
~~~~~~~~~~~~~~~~~~~~~~^^^^^^^^^^^^^^^^^^^^^^^^^^^^^^
|
|
File "/home/martin/.local/lib/python3.13/site-packages/anthropic/_client.py", line 196, in _validate_headers
|
|
raise TypeError(
|
|
'"Could not resolve authentication method. Expected either api_key or auth_token to be set. Or for one of the `X-Api-Key` or `Authorization` headers to be explicitly omitted"'
|
|
)
|
|
TypeError: "Could not resolve authentication method. Expected either api_key or auth_token to be set. Or for one of the `X-Api-Key` or `Authorization` headers to be explicitly omitted"
|