İçeriğe geç
ai101.tools
gezesckapat
Claude+372Whisper+228LangChain+168Codex+223NotebookLM+276DALL-E 3+192DeepL+249n8n+208Topaz Video AI+153LlamaIndex+161
PluginEval logo
Skill

PluginEval

Bir Claude Code skill'ini on boyutta puanlıyor: statik denetim, LLM hakemi ve Monte Carlo koşuları.

0
KaydetSiteye git ↗

Kurulum

Script içeriyor
Claude Code: /plugin marketplace add wshobson/agents → /plugin install plugin-eval@claude-code-workflows
Ne zaman devreye girer

Yazılan bir skill ya da eklentinin kalitesi ölçülürken, iki skill karşılaştırılırken ya da bir pazar yeri için puan eşiği belirlenirken

Geliştirici
Seth Hobson
Lisans
MIT

Üç katman üst üste biniyor, her biri bir öncekinden pahalı: SKILL.md'yi ayrıştırıp iki saniyenin altında biten statik geçiş, tetiklenme-düzenleme-çıktı-kapsam boyutlarını otuz saniye civarında puanlayan LLM hakemi ve skill'i elli ila yüz kez koşturarak güvenilirlik tahmini çıkaran Monte Carlo katmanı. Statik denetimlerin kendine göre bir duruşu var, bunu skill yazmadan önce bilmek işe yarıyor: kademeli açığa çıkarma 200-600 satırlık bir tatlı noktaya göre ölçülüyor, tespit edilen her anti-desen katman puanını yüzde beş daha aşağı çekiyor ve taban yarıda duruyor. Sonuçlar bir külliyata karşı Elo sıralamasına giriyor, yani skill mutlak bir barajla değil emsalleriyle karşılaştırılıyor. Paket gerçek bir Python projesi, test takımıyla birlikte geliyor; salt istem dosyası değil.

Yorumlar(0)

Yorum yapmak için giriş yap

Henüz yorum yok — ilk yorumu sen yaz.

Benzer skill'ler

Bu yorumu şikayet et

Neden şikayet ediyorsun?