İçeriğe geç
Model Arena

Yöntem

Bir karşılaştırma ancak koşulları biliniyorsa işe yarar. Burada her şey açık.

Adil koşullar

Her model aynı promptu alır. Tek deneme yapılır: ilk çıktı neyse o kaydedilir, düzeltme ya da ikinci şans yoktur.

Claude modelleri claude -p, OpenAI modelleri codex exec ile çağrılır. Her iş ayrı, boş bir klasörde çalışır. Araç, MCP, skill ve kullanıcı ayarı yoktur. Her modele aynı sistem promptu verilir: tek dosyalık, kendi içinde tamamlanmış bir HTML.

Tüm işler aynı anda başlar, böylece süreler aynı koşullarda ölçülür. Efor seviyesi her çalıştırmada açıkça yazılır.

Kullanılan ayarlar

Aşağıdaki değerler doğrudan çalıştırıcının yapılandırmasından okunur.

Modeller
Sonnet 5Sonnet 5.5Opus 5.5GPT-6 AstraGPT-6 SolGPT-6 Luna
Efor seviyeleri
varsayılan, düşük, orta, yüksek, çok yüksek, maksimum
En fazla tekrar
3
İş başına zaman aşımı
60 dakika
Çalışma klasörü
Boş, ayrı bir klasör

Her modele verilen sistem promptu

You are generating a single self-contained HTML file. Respond with only the complete HTML document, starting with <!DOCTYPE html>. No explanation, no markdown fences. Inline all CSS and JS. No external network requests.

Sabit metin, İngilizce. Bağlantı izinli promptlarda yalnızca son cümle değişir.

Puanlı testler nedir

Puanlı promptlarda testler modele verilmez. Çıktı sunulurken test dosyası sayfanın sonuna eklenir ve sayfa yüklenince çalışır.

Sonuç geçen test sayısıdır. Bazı testler kodun hızını da ölçer: bu süre yalnızca tüm hız testleri doğru geçtiyse kaydedilir.

Testleri, bir referans çözümle doğrulamadan eklemiyorum. Yanlış bir beklenti doğru çözen modeli cezalandırırdı.

Kategoriler

  • Vitrin

    Henüz çalıştırma yok

    Türkiye’den 3D sahneler ve ebru. Modelin görsel zevkini ve kod kabiliyetini birlikte gösterir.

  • Puanlı

    Henüz çalıştırma yok

    Modelin görmediği gizli testlerle ölçülür. Sonuç geçen test sayısı ve kodun hızıdır.

  • Zor görsel

    Henüz çalıştırma yok

    Rubik küpü, saat mekanizması, PacMan. Hata gözle görülür, bu yüzden saklanamaz.

  • Lansman demoları

    Henüz çalıştırma yok

    Model lansmanlarında gösterilen promptlar ve topluluğun klasikleri.

Efor seviyeleri

Efor, modelin cevaba başlamadan önce ne kadar düşüneceğini belirleyen ayardır.

Lansman koşularında her model iki ayarda çalışır. Varsayılan, ürünün kendi ayarıdır; kullanıcının günlük kullanımda gördüğü davranış budur. Maksimum, laboratuvarların lansmanda raporladığı tavandır.

Düşünme ve cevap aynı token tavanını paylaşır. Maksimum eforda model tavanı düşünmeye harcayıp HTML yazamadan durabilir. Böyle bir iş başarısız sayılır ve sayfada nedeni, harcadığı token ve süreyle birlikte görünür.

Efor adları üreticiler arasında eşdeğer değil. Bu yüzden her sonucun yanında süre, token ve maliyet de yazar.

Sınırlar

Bunlar benim testlerim. Başka testlerde sıralama değişebilir.

Her prompt için tek deneme yapılıyor, tekrar sayısı en fazla üç. Küçük örneklemden büyük sonuç çıkarmayın.

Burada bir “en iyi model” hükmü yok ve olmayacak. Görsel sonuçlar zevke bağlıdır: kendi gözünüzle bakın, gerekirse Kör modunu kullanın.

Maliyet farkı, Kör modda bile modelin kim olduğuna dair ipucu verebilir.

Kendiniz bakın

Sonuçları yan yana açın, modelin adını gizleyip hangisini seçeceğinize bakın.