LLM Finetuning
İnce ayarı, eğitim ayarları yazılmadan önce değerlendirme takımının kurulduğu kapılı bir döngü olarak işletiyor.
Kurulum
Claude Code: /plugin marketplace add wshobson/agents → /plugin install llm-finetuning@claude-code-workflows
Açık ağırlıklı bir model uçtan uca ince ayarlanırken, değerlendirme takımı kurulurken ya da bir checkpoint'in yayına çıkıp çıkmayacağına karar verilirken
- Geliştirici
- Seth Hobson
- Lisans
- MIT
On bir skill işi sıraya koyuyor: ince ayar gerçekten gerekli mi, değerlendirme takımı, veri derleme, eğitim ve son olarak checkpoint kapısı. Yönlendirme skill'i ilk bölümünü çıkış yollarına ayırmış; sık değişen olgular RAG'e, henüz oturmamış davranış isteme ait, çünkü "şunu ince ayarlayalım" diye gelen isteklerin çoğu başka yerde daha ucuza çözülüyor. Değerlendirmenin önde olması bilinçli: altın kümeyi üreten etiketli izler aynı zamanda eğitim verisini de üretiyor ve her altın örnek kimliğiyle dışarıda bırakılıyor, böylece sızıntı skoru sessizce şişiremiyor. Terfi dört aşamalı bir kapı; ayrılmış altın kümede kazanıp taban modelle eşli karşılaştırmayı kaybeden checkpoint yayına çıkmıyor. Yöntemler LoRA ve QLoRA'dan DPO'ya, oradan doğrulanabilir ödüllü GRPO'ya uzanıyor, GGUF ya da FP8 dışa aktarımıyla bitiyor.
Benzer skill'ler
Protect MCP
SkillHer araç çağrısını Cedar politikasından geçiriyor ve kararı zincirlenmiş imzalı bir makbuza yazıyor.
PluginEval
SkillBir Claude Code skill'ini on boyutta puanlıyor: statik denetim, LLM hakemi ve Monte Carlo koşuları.
Skill Forge Essentials
SkillÜç davranış skill'i, insanların değil ajanların yaptığı hatalara nişan alıyor.
Yorumlar(0)
Yorum yapmak için giriş yap