Skip to content

Latest commit

 

History

History
78 lines (55 loc) · 3.48 KB

File metadata and controls

78 lines (55 loc) · 3.48 KB

Katkı · Contributing

Bu bir araştırma deposudur. En değerli katkı bir pull request değil, bir ölçüm veya bir itirazdır: bir sonucu tekrar üretmek, bir sınırı zorlamak, ya da bir iddianın neden yanlış olabileceğini göstermek.

This is a research repository. The most valuable contribution is not necessarily a pull request — it is a measurement or a counter-argument: reproducing a result, pushing a limit, or showing why a claim might be wrong.

Nasıl başlanır · Getting started

pip install torch==2.7.1 --index-url https://download.pytorch.org/whl/cu118
pip install -r requirements.txt

Veri ve ağırlık manifestosu, deney komutları ve ham çıktılardan güven aralığının yeniden üretimi: REPRODUCE.md.

Açık araştırma soruları · Open research questions

Bunlar bizim de cevabını bilmediğimiz sorular. Kısmi bir sonuç bile değerlidir.

1. Tavan gerçekten ~%22 mi, yoksa reçete mi sınırlıyor? %25'te bozulma anlamlı hale geliyor. Bu bir kapasite sınırı mı, yoksa daha geniş ko-eğitim (MLP-LoRA, daha çok veri, çok seed) sınırı yukarı taşır mı? → Ölçüm: aynı protokolde %25 konfigürasyonunu genişletilmiş reçeteyle ko-eğit.

2. Yerleşim kuralı genellenebilir mi? "Çıpalar arasına yay" bulgusu Erk-14B/Qwen3 mimarisinde doğrulandı. Başka bir taban modelde (farklı derinlik, farklı GQA oranı) aynı etki çıkıyor mu?

3. ≥16K uzun bağlamda ne oluyor? NIAH yalnızca ≤4K'da test edildi ve tavana oturdu (%100/%100). Ayrıştırıcı bir uzun-bağlam testi (≥16K, çok-iğne, sıralı geri-çağırma) hibridi nerede kırar?

4. Decode hızı ne kadar? KV-bellek tasarrufunu ölçtük; otoregresif decode hızını ölçmedik. Cache-doğru sarmalayıcıyla token/sn karşılaştırması açık bir iş.

5. Enerji ayak izi. Belleği ölçtük, enerjiyi ölçmedik. Token başına enerji (oracle vs hibrit) dürüst ve yararlı bir ölçüm olurdu.

6. Türkçe dışı diller. Yöntem dile bağlı değil; bulgular başka bir dilde tekrar ediyor mu?

Ölçüm gönderirken · When you send a measurement

Sonucun karşılaştırılabilir olması için:

  • Aynı protokol. Oracle ve hibrit birebir aynı prompt/skorlama ile ölçülmeli.
  • Güven aralığı. Nokta tahmini tek başına yeterli değil; soru-bazlı paired bootstrap %95 GA ekleyin.
  • Ham çıktı. Mümkünse soru-bazlı tahminleri paylaşın ki GA yeniden üretilebilsin (bkz. results/raw_predictions.json biçimi).
  • Seçim sızıntısı yok. Model/checkpoint seçiminde kullandığınız soruları raporladığınız skordan çıkarın.
  • Ortam. Sürümler ve donanım (requirements.txt'ten sapma varsa belirtin).

Negatif sonuç da sonuçtur — bir şeyin çalışmadığını gösteren bir ölçüm, çalıştığını gösteren kadar değerlidir ve aynı özenle karşılanır.

Kod katkısı · Code contributions

  • Betikler tek bir işi yapar ve ne ölçtüklerini docstring'de tek cümleyle söyler.
  • Sayısal mantığı değiştiren bir PR, hangi sonucun nasıl değiştiğini göstermelidir.
  • Yollar göreli ve parametrik olmalı; makineye özel mutlak yol eklemeyin.

Davranış · Conduct

Teknik eleştiri sert olabilir, kişisel olamaz. İddiaya değil, ölçüme itiraz edin — ve kendi iddianızı da ölçüyle destekleyin.

Lisans · License

Katkılarınız Apache-2.0 altında yayımlanır (bkz. LICENSE).