PluginEval
Bir Claude Code skill'ini on boyutta puanlıyor: statik denetim, LLM hakemi ve Monte Carlo koşuları.
Kurulum
Script içeriyorClaude Code: /plugin marketplace add wshobson/agents → /plugin install plugin-eval@claude-code-workflows
Yazılan bir skill ya da eklentinin kalitesi ölçülürken, iki skill karşılaştırılırken ya da bir pazar yeri için puan eşiği belirlenirken
- Geliştirici
- Seth Hobson
- Lisans
- MIT
Üç katman üst üste biniyor, her biri bir öncekinden pahalı: SKILL.md'yi ayrıştırıp iki saniyenin altında biten statik geçiş, tetiklenme-düzenleme-çıktı-kapsam boyutlarını otuz saniye civarında puanlayan LLM hakemi ve skill'i elli ila yüz kez koşturarak güvenilirlik tahmini çıkaran Monte Carlo katmanı. Statik denetimlerin kendine göre bir duruşu var, bunu skill yazmadan önce bilmek işe yarıyor: kademeli açığa çıkarma 200-600 satırlık bir tatlı noktaya göre ölçülüyor, tespit edilen her anti-desen katman puanını yüzde beş daha aşağı çekiyor ve taban yarıda duruyor. Sonuçlar bir külliyata karşı Elo sıralamasına giriyor, yani skill mutlak bir barajla değil emsalleriyle karşılaştırılıyor. Paket gerçek bir Python projesi, test takımıyla birlikte geliyor; salt istem dosyası değil.
Benzer skill'ler
Framework Migration
SkillGöç stratejisini herkese aynı öneriyle değil kod tabanının boyutuna göre seçiyor.
Accessibility Compliance
SkillWCAG 2.2 denetimi; doğrulayıcı ajan ekran görüntüsü kanıtlamadan düzeltmeyi başarısız sayıyor.
Security Scanning
SkillSAST kurulumu, bağımlılık taraması ve STRIDE tehdit modellemesini tek eklentide topluyor.
Yorumlar(0)
Yorum yapmak için giriş yap