Adil koşullar
Her model aynı promptu alır. Tek deneme yapılır: ilk çıktı neyse o kaydedilir, düzeltme ya da ikinci şans yoktur.
Claude modelleri claude -p, OpenAI modelleri codex exec ile çağrılır. Her iş ayrı, boş bir klasörde çalışır. Araç, MCP, skill ve kullanıcı ayarı yoktur. Her modele aynı sistem promptu verilir: tek dosyalık, kendi içinde tamamlanmış bir HTML.
Tüm işler aynı anda başlar, böylece süreler aynı koşullarda ölçülür. Efor seviyesi her çalıştırmada açıkça yazılır.
Kullanılan ayarlar
Aşağıdaki değerler doğrudan çalıştırıcının yapılandırmasından okunur.
- Modeller
- Sonnet 5Sonnet 5.5Opus 5.5GPT-6 AstraGPT-6 SolGPT-6 Luna
- Efor seviyeleri
- varsayılan, düşük, orta, yüksek, çok yüksek, maksimum
- En fazla tekrar
- 3
- İş başına zaman aşımı
- 60 dakika
- Çalışma klasörü
- Boş, ayrı bir klasör
Her modele verilen sistem promptu
You are generating a single self-contained HTML file. Respond with only the complete HTML document, starting with <!DOCTYPE html>. No explanation, no markdown fences. Inline all CSS and JS. No external network requests.
Sabit metin, İngilizce. Bağlantı izinli promptlarda yalnızca son cümle değişir.
Puanlı testler nedir
Puanlı promptlarda testler modele verilmez. Çıktı sunulurken test dosyası sayfanın sonuna eklenir ve sayfa yüklenince çalışır.
Sonuç geçen test sayısıdır. Bazı testler kodun hızını da ölçer: bu süre yalnızca tüm hız testleri doğru geçtiyse kaydedilir.
Testleri, bir referans çözümle doğrulamadan eklemiyorum. Yanlış bir beklenti doğru çözen modeli cezalandırırdı.
Kategoriler
Vitrin
Henüz çalıştırma yokTürkiye’den 3D sahneler ve ebru. Modelin görsel zevkini ve kod kabiliyetini birlikte gösterir.
Puanlı
Henüz çalıştırma yokModelin görmediği gizli testlerle ölçülür. Sonuç geçen test sayısı ve kodun hızıdır.
Zor görsel
Henüz çalıştırma yokRubik küpü, saat mekanizması, PacMan. Hata gözle görülür, bu yüzden saklanamaz.
Lansman demoları
Henüz çalıştırma yokModel lansmanlarında gösterilen promptlar ve topluluğun klasikleri.
Efor seviyeleri
Efor, modelin cevaba başlamadan önce ne kadar düşüneceğini belirleyen ayardır.
Lansman koşularında her model iki ayarda çalışır. Varsayılan, ürünün kendi ayarıdır; kullanıcının günlük kullanımda gördüğü davranış budur. Maksimum, laboratuvarların lansmanda raporladığı tavandır.
Düşünme ve cevap aynı token tavanını paylaşır. Maksimum eforda model tavanı düşünmeye harcayıp HTML yazamadan durabilir. Böyle bir iş başarısız sayılır ve sayfada nedeni, harcadığı token ve süreyle birlikte görünür.
Efor adları üreticiler arasında eşdeğer değil. Bu yüzden her sonucun yanında süre, token ve maliyet de yazar.
Sınırlar
Bunlar benim testlerim. Başka testlerde sıralama değişebilir.
Her prompt için tek deneme yapılıyor, tekrar sayısı en fazla üç. Küçük örneklemden büyük sonuç çıkarmayın.
Burada bir “en iyi model” hükmü yok ve olmayacak. Görsel sonuçlar zevke bağlıdır: kendi gözünüzle bakın, gerekirse Kör modunu kullanın.
Maliyet farkı, Kör modda bile modelin kim olduğuna dair ipucu verebilir.
Kendiniz bakın
Sonuçları yan yana açın, modelin adını gizleyip hangisini seçeceğinize bakın.