Econophysics ölçümleri — araştırma defteri

Fizik-kökenli modellerin dürüst ölçümü: OU stat-arb, transfer-entropy, EVT-CVaR, SADF/LPPLS, DFA-Hurst… çoğu ÖLDÜ (başarı), hiçbiri canlıyı değiştirmez.

gerçek emir yok
Canlı · 5s

Econophysics ölçümleri — araştırma defteri

Fizik-kökenli 30 modelin sisteme sinyal/yarış/dial olarak nasıl ekleneceğinin araştırması. Her satır bir ölçüm: her sinyalin geçtiği aynı dürüst makineden (deflasyon bataryası, dekorelasyon sandbox'ı, simüle-null kapı) geçer ve dürüst kararı taşır. Çoğu öldü — bu bir başarıdır (araştırılan sinyallerin ÇOĞU ölmeli; kendini kandırmamak asıl iş). Hiçbiri canlı bir kaldıraç/portföy kararını DEĞİŞTİRMEZ; her biri insan-kapılı ayrı bir terfi adımı bekler.

Not: bu ölçümler sentetik/demo veride koştu (canlı akış operatörün paper-run kurulumunu bekliyor). Her birinin Python kaynağı kartın altında; her modül düşman-gözlü bir review workflow'undan geçti.

Ölçüm
13
econophysics rollout
Dürüst ÖLÜM
5
battery/ensemble geçemedi
Geçti / doğrulandı
8
kapı/korumayı hak etti
Canlı değişiklik
0
hepsi ölçüm — terfi ayrı
🏁 yarışıyor (2) — yönlü al/sat, sabit modellerle AYNI yarışta (karta tıkla → canlı satır)🛡️ de-risk dial'ı (5) — al/sat DEĞİL, sadece tehlikede kaldıraç kısar📏 kalibrasyon (6) — altyapı/ölçüm, tek başına canlıyı değiştirmez

Her ekonofizik modelinin sistemde TEK bir rolü var — hiçbir kart artık ölü-uç değil: ya yarışır, ya de-risk eder, ya kalibre eder.

#1RMT kovaryans temizleme

Yapıda geçer · gürültüde 0/50
Kovaryans📏 kalibrasyon / ölçüm

Rastgele-matris teorisiyle temizlenmiş kovaryans, örneklem-dışında 1/N'den DAHA az oynaklık üretir mi?

Ne ölçer

Varlıkların birlikte-hareketini tahmin eden matrisin, gürültüyü ayıklanmış hâlinin gerçekten daha güvenilir olup olmadığını ölçer.

Günlük analoji

Bulanık bir grup fotoğrafını keskinleştirmek gibi: gerçekten netleştiyse yüzler ayrışır; sadece 'keskinleştirdim' demek yetmez, kontrol gerekir.

Neden önemli

Portföy riski bu matristen okunur; kirli bir matris riski yanlış tahmin edip fazla kaldıraç aldırır.

Bulgu (gerçek sayılarla)

Dürüst kapı: temizlenmiş matris 1/N'i OOS oynaklıkta effect_floor kadar yenmeli VE walk-forward fold'ların %60'ında VE örnek-matrisi yenmeli. Sonuç: saf gürültüde 0/50 ateşliyor (yanlış güven yok), yapıda 35/50. Marchenko-Pastur + analitik nonlinear shrinkage.

kaynak · python/sp_research/rmt_bench.py

#3Kapasite — karekök etki yasası

Düzeltildi · √-yasasına uyar
Kapasite📏 kalibrasyon / ölçüm

Bir stratejinin alfası, kitap büyüdükçe hangi büyüklükte SIFIRA düşer (kapasite tavanı)?

Ne ölçer

Ne kadar para yönetilebileceğini: işlem, fiyatı ne kadar iterse (piyasa etkisi) o kadar erken kâr biter.

Günlük analoji

Küçük bir gölde balık tutmak gibi: birkaç olta sorun değil ama yüz olta suyu boşaltır — belli bir noktadan sonra tutacak balık kalmaz.

Neden önemli

Kapasiteyi bilmeden ölçeklenen bir strateji kendi etkisiyle kârını yer; break-even büyüklüğü sert bir limittir.

Bulgu (gerçek sayılarla)

Break-even artık karekök (concave) piyasa-etki yasasını onurlandırıyor: net alfanın sıfırlandığı kitap büyüklüğü genel güç-yasası çözümüyle bulunur, gamma=1'de doğrusala iner. Tóth √-impact.

kaynak · python/sp_research/capacity.py

#5Refleksivite dial'i (Hawkes)

LR-kapılı · sakin tapede 0/60
Rejim🛡️ de-risk dial'ı

Piyasa kendi kendini besliyor mu (endojen kaskad), yoksa dıştan mı sürülüyor — ve bu güvenilir ölçülebilir mi?

Ne ölçer

Bir hareketin ne kadarının 'başka hareketleri tetiklemesinden' geldiğini (dallanma oranı) ölçer.

Günlük analoji

Bir stadyumdaki tezahürat gibi: dışarıdan bir sebep mi başlattı, yoksa insanlar birbirini mi kışkırtıyor? İkincisi kırılgandır — küçük bir kıvılcım paniğe döner.

Neden önemli

Yüksek refleksivite kırılgan rejim demek; bir de-risk dial'ı olarak kaldıracı kısar (yalnız kısar, EKLEMEZ).

Bulgu (gerçek sayılarla)

Olabilirlik-oranı anlamlılık kapısı (LR_MIN=5, MC-kalibre): Poisson null'a karşı anlamlı değilse 'düşük' bandı döner. Sonuç: sakin tapede 0/60 yanlış-alarm, kümelenmede 60/60. NaN barlar olay-tespitinden dışlanır.

🛡️ De-risk yığınına besler → al/sat sinyali DEĞİL — yalnız tehlikede kaldıracı KISAR (tek-yönlü)/laboratuvar
kaynak · python/sp_research/reflexivity.py

#7De-risk çarpan yığını

Tek-yönlü · yalnız keser
Rejim🛡️ de-risk dial'ı

Rejim dial'ları (türbülans, refleksivite, patlayıcılık, N_eff) tek bir kaldıraç-çarpanına nasıl DÜRÜSTÇE birleşir?

Ne ölçer

Birden çok 'tehlike göstergesini' tek bir 'ne kadar küçül' sayısına indirir — en savunmacı olan kazanır.

Günlük analoji

Arabadaki birden çok uyarı ışığı gibi: hangisi en kötüyse gaza o kadar az basarsın; hiçbiri seni HIZLANDIRMAZ.

Neden önemli

Yalnız-kesen bir çarpan terfi (battery) gerektirmez — getiri UYDURAMAZ. 'Getiri ekliyor' der demez battery şart.

Bulgu (gerçek sayılarla)

Her dial [1-cut, 1]'e eşlenir, MIN ile birleşir, [floor, 1]'e klipslenir — asla >1. Hesaplanamayan (NaN) dial kesmez (eksik bilgide küçülmeyiz).

🛡️ De-risk yığınına besler → al/sat sinyali DEĞİL — yalnız tehlikede kaldıracı KISAR (tek-yönlü)/laboratuvar
kaynak · python/sp_research/regime_overlay.py

#8OU / Avellaneda-Lee stat-arb (tek başına)

ÖLDÜ · DSR ≈ 0.03
Stat-arb📏 kalibrasyon / ölçüm

Doküman'ın #1 kanıtlanmış alfası (PCA öz-portföy + OU s-score) deflasyon bataryasını tek başına geçer mi?

Ne ölçer

Bir 'ortalamaya-dönüş' stratejisinin, çoklu-test cezasından sonra 1/N'i gerçekten yenip yenmediğini ölçer.

Günlük analoji

Bir gerilmiş lastiği bırakınca eski hâline döner — strateji de 'pahalı olan düşecek, ucuz olan çıkacak' bahsi yapar. Ama şansla mı kazandı?

Neden önemli

Long-only arena market-neutral edge'i kırpar; kripto BTC-faktörü baskın → residual seyrek işlem görür.

Bulgu (gerçek sayılarla)

Yapıda kitap 1/N'i holdout'ta YENİYOR (s-score tilt'i çalışıyor) ama DSR ≈ 0.03 ≪ 0.95 → trial-sonrası deflasyondan geçemez. Saf gürültüde PBO ≈ 0.60 overfit alarmı ayrıca ateşler. Bilgilendirici bir ölüm.

kaynak · python/sp_research/statarb_pca_battery.py

#8 · pt2OU kitabı ENSEMBLE'a yarıyor mu?

Temiz ÇİFT-HAYIR
Stat-arb📏 kalibrasyon / ölçüm

Tek başına ölen model, DEKORELE olduğu için champion ensemble'a yine de değer katabilir mi (Grinold-Kahn breadth)?

Ne ölçer

Bir modelin, ekibe kattığı DEĞERİN 'kendi getirisi' mi yoksa 'başkalarıyla farklı zamanlaması' mı olduğunu ayırır.

Günlük analoji

Bir takıma zayıf ama FARKLI oynayan bir oyuncu almak gibi: tek başına iyi olmasa da takımın açığını kapatıyorsa değerlidir — kapatmıyorsa değil.

Neden önemli

'Eklenmemeli' denen modellerin ileride ensemble olarak işe yarayıp yaramayacağını ölçüyle yanıtlar, dogmayla değil.

Bulgu (gerçek sayılarla)

admitted=[], p≈1.0: long-only OU çoğu bar 1/N'e düşer → core ile BİRLİKTE hareket eder → komplementer zamanlama YOK. Sınır 'yüksek korelasyon' değil 'anti-zamanlama yokluğu' (falsifiability testi: 0.96 korele ama anti-zamanlı aday KABUL edilir).

kaynak · python/sp_research/statarb_ensemble_probe.py

#8 · pt3Market-neutral (long-short) OU — artık YARIŞIYOR

Canlı yarışta: dolar-nötr al/sat kitabı · kriptoda ~%-21 (19/28)
Stat-arb🏁 yarışıyor

Tam (dollar-nötr long-short) OU edge'i sabit modellerle AYNI yarışta nasıl performans gösterir?

Ne ölçer

Stratejinin 'sadece uzun' değil, hem uzun (UCUZ artığı AL) hem kısa (PAHALI artığı SAT) tam hâlinin gerçek yarıştaki gücünü ölçer.

Günlük analoji

Bir teraziyi iki koldan da yüklemek gibi: tek kol (long-only) piyasanın genel yönüyle sallanır; iki kol dengede kalır ve saf beceriyi gösterir. Artık bu iki-kollu kitap sahada, ötekilerle yarışıyor.

Neden önemli

#8 sentetik panelde 'yapıda geçer' dedi ama gerçek kripto evreni AÇIK soruydu. Artık o soru CANLI yanıtlanıyor: kitap sahada yarışıyor, sonucu görünür.

Bulgu (gerçek sayılarla)

ARTIK CANLI YARIŞIYOR — arena'ya eklenen TEK gerçek long-short (dolar-nötr) kitap: PCA-artığına OU uydurur, UCUZ artıkları AL / PAHALI olanları SAT, her taraf %50 brüt (net~0), 5 günde bir PIT yeniden fit, ~%15 vol-hedefli (adil risk). GERÇEK kripto evreninde: aktif Sharpe -0.60, toplam ~%-21 (backtest ~%-3, canlı ~%-19), 28 kitapta 19. sırada — birkaç long-only reversal kitabını GEÇİYOR ama para kaybediyor. DÜRÜST BULGU: kriptoda artık seyrek reverting → kitap 1-2 isme yoğunlaşır → OU kripto gibi trend-baskın evrende ölür (#8 doğrulandı, ama ARTIK sahada görünür, ölü defterde değil). OU'nun evi mean-reverting hisse/ETF çiftleri, trend'li kripto değil.

🏁 Artık canlı yarışıyor → OU İstatistiksel Arbitraj (dolar-nötr al/sat) (aktif Sharpe -0.60 · ~%-21 · 19/28)/yaris
kaynak · python/sp_research/arena.py

Frozen #1Schreiber transfer-entropy lead-lag — artık YARIŞIYOR

Canlı yarışta: long-only +%122 (beta, sıfır edge) · al/sat +%47
Bilgi akışı🏁 yarışıyor

Hangi varlık hangisini ÖNDER (yönlü bilgi akışı) — ve bu lead-lag sinyali sabit modellerle aynı yarışta nasıl performans gösterir?

Ne ölçer

Bir varlığın geçmişinin, BAŞKA bir varlığın geleceğini kendi geçmişinin ötesinde ne kadar açıkladığını (yönlü kuplaj) ölçer; sonra takipçileri öncülerinin yönüne yaslar.

Günlük analoji

Bir orkestrada ilk kemanın diğerlerini yönlendirmesi gibi: kim başlıyor, kim takip ediyor? Takip edeni önceden bilirsen kısa bir avantajın olur. Artık bu bahis sahada, ötekilerle yarışıyor.

Neden önemli

'Eklenmemeli' dediğim davranışsal modellerin ilkiydi. Artık yarışta: gerçek bir al/sat edge'i mi, yoksa sadece piyasa betası mı — leaderboard söylüyor.

Bulgu (gerçek sayılarla)

ARTIK CANLI YARIŞIYOR, iki frame'de. LONG-ONLY (te_leadlag): toplam +%122 ama aktif Sharpe -0.10, 30 kitapta 9. — yani PARA kazandırdı ama neredeyse tamamı kripto BETASI; 1/N'i geçen bir edge YOK (uzun-only kripto boğasını biner). DOLAR-NÖTR AL/SAT (te_leadlag_ls): betayı atar, ~+%47 ham getiri ama aktif Sharpe -0.52 (20. sıra). DÜRÜST OKUMA: TE öncü-takipçi yapıyı yakalıyor ama kriptoda güvenilir bir yönlü ALFA değil — beta çıkınca zayıflıyor. Long-only'nin yüksek getirisiyle al/sat'ın düşük getirisi arasındaki fark tam da 'beta ≠ beceri' dersi. Estimator DOĞRU (brute-force'a 1.9e-14).

🏁 Artık canlı yarışıyor → Transfer-Entropy Öncü-Takipçi (long-only + dolar-nötr al/sat) (long-only +%122 (Sharpe -0.10, 9/30) · al/sat +%47 (-0.52, 20/30))/yaris
kaynak · python/sp_research/arena.py

#4EVT canlı CVaR cap'ini değiştirmeli mi?

%90'da BERABERE → değişme · derin kuyrukta EVT daha iyi
Kuyruk riski🛡️ de-risk dial'ı

Uç-değer teorisi (EVT/GPD) tail'i, canlı kaldıraç-cap'ini besleyen historical CVaR'dan DAHA doğru mu?

Ne ölçer

'En kötü %X günde ne kadar kaybederim' tahmininin, hangi yöntemle GERÇEĞE daha yakın olduğunu ölçer.

Günlük analoji

Bir barajın taşma seviyesini tahmin etmek gibi: sık görülen su seviyeleri için basit ortalama yeter; ama 100-yıllık selde uç-değer matematiği gerekir.

Neden önemli

Cap bir risk limiti; daha doğru bir tail, kaldıracı doğru anda kısar. Ama gereksiz karmaşıklık da eklenmemeli.

Bulgu (gerçek sayılarla)

Doğruluk ANALİTİK Student-t ES'e karşı (8M-MC'ye <%1 doğrulandı). Cap'in %90'ında iki yöntem BERABERE (rel-hata ~0.084 vs ~0.088) → değişmeye değmez. AMA %99 derin kuyrukta EVT ağır-kuyrukta MATERYAL daha iyi. Karar: %90'da historical kalsın; EVT ancak cap derinleşirse değer. Bir review eski 'EVT %99'da kötü' iddiasını hatalı eşik formülüyle açıkladı — düzeltildi.

🛡️ De-risk yığınına besler → al/sat sinyali DEĞİL — yalnız tehlikede kaldıracı KISAR (tek-yönlü)/laboratuvar
kaynak · python/sp_research/evt_cvar_bench.py

#6SADF/LPPLS → de-risk kaldıraç dial'i

Dürüst kapı · gürültüde ~%5
Rejim🛡️ de-risk dial'ı

Patlayıcı-kök (SADF, balon imzası) + log-periyodik balon-şekli (LPPLS), kaldıracı DÜRÜSTÇE kısan bir dial olur mu?

Ne ölçer

Fiyatın 'rastgele yürüyüşten hızlı' (üstel-üstü) büyüyüp büyümediğini — bir balonun istatistiksel imzasını — ölçer.

Günlük analoji

Bir balonu şişirmek gibi: belli bir noktadan sonra her üfleme patlamayı yaklaştırır. Genişleme hızı 'normal'in çok üstündeyse geri çekilirsin.

Neden önemli

Balonda kaldıracı kısmak korunmadır (yalnız keser). Ama sakin tapede sürekli kısarsa işe yaramaz — kapı DÜRÜST olmalı.

Bulgu (gerçek sayılarla)

SADF dial'ının calm/danger eşikleri örnek uzunluğunda SİMÜLE 95%/99% kritik değer (sabit eşik kısa örnekte over-flag eder). Kalibrasyon: rastgele yürüyüşte ~%5 yanlış-alarm (HER ZAMAN değil), patlayıcı ρ>1'de ~%80 tespit. LPPLS bacağı KALİBRE DEĞİL (~%35) → default KAPALI, dürüstçe ifşa. NaN → güvenli-kesmez.

🛡️ De-risk yığınına besler → al/sat sinyali DEĞİL — yalnız tehlikede kaldıracı KISAR (tek-yönlü)/laboratuvar
kaynak · python/sp_research/sadf_lppls_derisk.py

Frozen #2q-Gaussian kuyruk → de-risk dial

Dürüst kapı · gürültüde ~%3
Kuyruk riski🛡️ de-risk dial'ı

Getirilerin kuyruk ağırlığı (Tsallis q) ne kadar? Şişman kuyruk anlamlı olduğunda kaldıracı dürüstçe kısan bir dial olur mu?

Ne ölçer

Getirilerin ne kadar 'şişman kuyruklu' olduğunu (aşırı hareketlerin sıklığını) tek bir sayıyla — Tsallis q indeksi — ölçer.

Günlük analoji

Bir yolun ne kadar tehlikeli olduğunu ölçmek gibi: normalde küçük tümsekler var (q=1), ama ara sıra derin çukurlar çıkıyorsa (q>1) daha yavaş sürersin.

Neden önemli

Şişman kuyruk = büyük kayıp riski. Bir de-risk dial'ı olarak kaldıracı kısar (yalnız kısar, EKLEMEZ) — ama sadece kuyruk GERÇEKTEN şişmanladığında.

Bulgu (gerçek sayılarla)

q örnek basıklıktan kestirilir (γ₂=6(q-1)/(5-3q) ilişkisinin tersi); BİLİNEN q'lu q-Gaussian (Student-t ν=(3-q)/(q-1)) örneklerinde doğrulandı. Honest-gate: calm/danger eşikleri Gaussian-null'ın SİMÜLE 95%/99% q kuantili → normal tapede ~%3 yanlış-alarm (HER ZAMAN değil), q=1.5 şişman kuyrukta %100 tespit. Tek-yönlü, canlıyı değiştirmez.

🛡️ De-risk yığınına besler → al/sat sinyali DEĞİL — yalnız tehlikede kaldıracı KISAR (tek-yönlü)/laboratuvar
kaynak · python/sp_research/q_gaussian.py

Frozen #3Rough volatility (Gatheral) — naif ölçüm confounded

Naif ölçüm confounded · estimator temiz veride DOĞRU
Rejim📏 kalibrasyon / ölçüm

Oynaklığın kendisi 'rough' mu (log-vol Hurst H≈0.1) — ve bu, naif realize-vol'den güvenilir ÖLÇÜLEBİLİR mi?

Ne ölçer

Oynaklığın zaman içinde ne kadar 'pürüzlü/dişli' (rough) yoksa 'yumuşak' hareket ettiğini — bir Hurst üsteliyle — ölçmeye çalışır.

Günlük analoji

Bir dağ patikasının pürüzlülüğünü ölçmek gibi: ama elindeki cetvel titriyorsa (ölçüm hatası), dümdüz bir yolu bile 'çok engebeli' okursun — engebeyi değil, cetvelin titremesini ölçmüş olursun.

Neden önemli

Rough-vol GERÇEK bir stilize gerçek ve bir vol-tahmincisini haklı çıkarabilir; ama önce ölçülebilir olmalı — ölçülemezse tahminci de haksızdır (önce-ölç kuralı).

Bulgu (gerçek sayılarla)

Estimator TEMİZ veride DOĞRU: bilinen H'li kesirli-Brown hareketinden H≈0.1'i bile geri kazanır (roughness_validation, |bias|≤0.08). AMA realize vol ÖLÇÜLÜR (birkaç getirinin std'i) ve bu ölçüm hatası beyaz gürültü = MAKSİMUM rough (H→0). Sonuç: SABİT-vol serisi bile rough okunur (gözlem 0.26 ≈ gürültü-kontrolü 0.26) ve gerçek rough-vol da (0.36) gürültü tabanını YENEMEZ → her ikisi de confounded=True. DÜRÜST HAYIR: naif ölçüm hata-düzeltmesi (Bolko-Pakkanen-Rosenbaum) olmadan rough-vol tahmincisini haklı çıkarmaz. Canlıyı değiştirmez.

kaynak · python/sp_research/rough_vol.py

#2DFA-Hurst (repo'nun kullandığı) doğrulaması

DFA doğrulandı · repoint gereksiz
Rejim📏 kalibrasyon / ölçüm

Hurst'ü R/S'den DFA'ya 'repoint' etmeli miyiz — yoksa repo zaten DFA mı kullanıyor ve bu seçim doğru mu?

Ne ölçer

Bir serinin 'trend mi, ortalamaya-dönüş mü, rastgele mi' olduğunu söyleyen Hurst üstelinin hangi yöntemle DOĞRU ölçüldüğünü sınar.

Günlük analoji

Bir nehrin akıntısını ölçmek gibi: iki farklı ölçüm aleti var; hangisi bilinen bir akıntıyı daha az sapmayla okuyorsa onu kullanırsın.

Neden önemli

Bir rejim-koşullayıcı yanlış 'trend' okursa yanlış kaldıraç alır; en tehlikeli yanlış, rastgele seriyi 'kalıcı' okumaktır.

Bulgu (gerçek sayılarla)

Premis BAYAT: repo Hurst'ü ZATEN DFA (trend_regime.hurst_dfa) — repoint edilecek R/S yok. Bu, o seçimi DOĞRULAR: bilinen Hurst'lü tam fGn'e (Cholesky) karşı DFA iyi-kalibre (|bias|~0.018) VE karar-kritik bölgede (H≤0.5) R/S'i yener (R/S düşük-H'de +0.12 pozitif yanlı). R/S yalnız H~0.6-0.8'de kazanır (dürüstçe kayıtlı → rigged değil).

kaynak · python/sp_research/hurst_estimator_bench.py

Epistemoloji — platformun kendi tevazuu (sayıyla)

Bunlar battery ÖLÇÜMÜ değil, tanı: aynı dürüst mantığı platformun KENDİaday setine uygular. Bir Sharpe'a inanmak için kaç yıl gerektiği (MinTRL) ve kaç "keşif"in deneme sayılınca buharlaştığı (replikasyon) — projenin neden hiçbir tek sayıya güvenmediğinin somut gerekçesi. Yukarıdaki ölüm/geçti sayaçlarına dahil DEĞİLLER.

Epistemoloji #1Minimum sicil uzunluğu — 'Sharpe gerçek olana kadar kaç yıl?'

En iyi kol Sharpe 0.54 · güven için ~9.1 yıl gerek (2.5 var)
Epistemoloji📏 kalibrasyon / ölçüm

Bir backtest Sharpe'ının şans değil gerçek beceri olduğuna %95 inanmak için kaç gözlem gerekir?

Ne ölçer

Bir Sharpe oranının sıfırdan istatistiksel olarak ayırt edilebilmesi için — skew ve şişman kuyruk düzeltmeleriyle — kaç bar/yıl kayıt gerektiğini ölçer.

Günlük analoji

Bir zarın hileli olup olmadığını birkaç atışla anlayamazsın; yüzlerce atış gerekir. Kısa bir kazanç serisi şans da olabilir — kayıt ne kadar uzunsa o kadar emin olursun.

Neden önemli

Kısa örnekte yüksek Sharpe bir seraptır. MinTRL 'daha ne kadar beklemelisin'i sayıyla söyler ve erken güveni keser — platformun her Sharpe'ın yanına yazması gereken sayı.

Bulgu (gerçek sayılarla)

Demo arenanın EN İYİ kolu (xsmom): yıllık Sharpe 0.54, PSR(>0)=0.80. AMA %95 güven için 3325 bar (~9.1 yıl) gerek; elde 900 bar (~2.5 yıl) var → have_enough=HAYIR. Yani 'Sharpe 0.54, ama gerçek demek için ~6.6 yıl DAHA lazım.' Bailey-López de Prado 2012; Deflated Sharpe ile aynı skew/kurtoz varyans terimi.

kaynak · python/sp_research/epistemology_report.py

Epistemoloji #2Replikasyon oranı — kaç 'keşif' deneme sayılınca buharlaşır?

27 adaydan 0'ı çoklu-test bariyerini geçti (yalnız 1'i naif t≥1.96)
Epistemoloji📏 kalibrasyon / ölçüm

't-istatistiği 2 olan 40 sinyal bulduk' — peki KAÇ tanesini denediniz? Çoklu test sayılınca kaçı ayakta kalır?

Ne ölçer

Aday sinyallerin t-istatistiklerinin, kaç deneme yapıldığı sayıldıktan sonra dürüst bir bariyeri (Bonferroni) geçme oranını ölçer.

Günlük analoji

1000 kişiye yazı-tura attırıp 10 kez üst üste tura geleni 'yetenekli' ilan etmek gibi. Ne kadar çok denersen birinin şansla parlaması o kadar olası — bariyeri denemeye göre yükseltmezsen kendini kandırırsın.

Neden önemli

Finansın kendi reprodüksiyon krizi: yayınlanmış anomalilerin ~%65'i tek bir t>1.96 testini bile geçemez (Hou-Xue-Zhang 2020). Ham t=2, 'kaç denemeden?' sorusu sorulmadan hiçbir şey ifade etmez.

Bulgu (gerçek sayılarla)

Demo arenanın 27 kolunun Sharpe t-statleri: naif eşik t≥1.96'yı yalnız 1/27 (%3.7) geçiyor; 27 deneme için Bonferroni eşiği t≥3.11'i ise 0/27 geçiyor. Yani çoklu-testten sonra HİÇBİR aday 'keşif' değil. Harvey-Liu çoklu-test bariyeri — platformun neden tek bir sinyale güvenmediğinin sayısı.

kaynak · python/sp_research/epistemology_report.py