TRL ve OpenEnv ile suluboya boyamak için bir kodlama modeli eğitimi

Özgün başlık: Training a coding model to paint watercolours with TRL and OpenEnv
23 Ağustos'ta Surya Narreddi, bir dil modelinin çizdiği suluboyalardan oluşan güzel bir video yayınladı. Model, JavaScript'i "p5.js'ye doğal çizim araçları ekleyen" bir kitaplık olan p5.brush aracılığıyla yazıyor. Video, bu yazının yazıldığı sırada 1,5 milyondan fazla izlenme sayısına ulaşarak viral hale geldi. Video, projenin daha önceki ve daha dar bir aşamasının ardındaki eğitimi açıklayan bir blog yazısı ile geldi; videodaki tam kompozisyonlar yerine yakın çekim çiçekler, ne yazık ki henüz açık eserler yoktu. Sitesi tam bir teknik raporun geleceğini söylüyor, bu yüzden onu takip ettiğinizden emin olun. Orijinal fikir ona ait, sanat ve tasarım yönünden geliyor ve onun becerileri benimkilerin çok ötesinde. Benim girişimim mühendislik tarafında, yayınlanan her parçayla birlikte tarifi açık bir şekilde yeniden üretmeye yönelik. Not: Surya'nın bizzat anlattığı projenin arkasındaki bağlamı öğrenmek için tezinin bu videosunu izleyin. Bu makalede onun fikrini TRL ve OpenEnv ile yeniden üretmeye çalışacağım. Referans havuzu veri kümesi, RL ortamı, eğitim komut dosyaları ve eğitilen modellerin tümü açıktır. Tüm süreç Hugging Face üzerinde, uçtan uca devam eder: Jobs üzerinde eğitim, RL ortamı ve Spaces olarak puanlayıcı modeli, Çıkarım Sağlayıcıları aracılığıyla ikili değerlendirme ve Hub'daki her yapı, tek bir koleksiyonda toplanmış İki Spaces hazır olduğunda, tarif tek bir komuttur.
Ortamı ve puanlayıcı modelini kopyalayın, ödül karışımı için iki ortam değişkeni ayarlayın ve başlatın: hf jobs uv run train/watercolour grpo.py --flavor h200 --timeout 48h --secrets HF TOKEN -- \ --env-url https://<you -watercolour-env.hf.space \ --model Qwen/Qwen3.5-35B-A3B --lora --all-linear --bf16 --gradient-checkpointing \ --subject 'bir şeftali amber çiçeği' --references 4 \ --top-p 0,95 --top-k 20 \ --lr 5e-5 --lr-scheduler ısınma ile sabit --warmup-steps 5 \ --scale-rewards none \ --steps 110 --n-episodes 240 --num- Generations 8 \ --per-device-batch-size 1 --gradient-accumulation-steps 8 \ --max-completion-length 8192 \ --run-tag my-run --out <you /watercolour-grpo --push-to-hub Bu makalenin geri kalanı oraya ulaşmanın hikayesidir ve her parça depodadır. Orijinal blogu adım adım takip ettim ve yalnızca kesinlikle ihtiyaç duyulduğunda bazı şeyleri değiştirdim. Benim her fikrim deney yerine bir listeye girdi ve bu liste, yayınlanmış eserlerin tam listesinin yanında, sonunda "Bundan sonra ne deneyeceğim" oldu.