CDSA-ATM

Hava Trafik Yönetimi Sütunu — MA-FedPPO Akış Optimizasyonu

Precomputed seeded CPU-scale runs (Faz A, June 2026) İnteraktif simülasyon — operasyonel değil

Faz A — Seed'li Referans Koşular

Not: Faz A metrikleri seed'li CPU-ölçek referans koşulardır ve sentetik/açık veriye dayanır. Yüksek kritik recall (0.919), Faz B'de karakterize edilen aşırı-uyarı rejimi içinde elde edilmiştir — aşağıdaki Faz B dürüstlük notuna bakınız.

Öğrenme Eğrileri

Kaynak: experiments/results/faz_a_curves.json (seed'li koşu, 11 Haziran 2026).

Konfigürasyon Karşılaştırması

Eğitilmiş Ajan Karar Örnekleri

Aksiyon dağılımı
Durum vektörü

Kaynak: experiments/results/sample_decisions.json — eğitilmiş FedProx ajanıyla seed'li inference örnekleri.

Faz B — Dayanıklılık ve Confusion-Matrix Analizi

Dürüstlük notu: Politika 5 eylemden yalnızca 2'sini kullanıyor ve tüm benign durumlar kritik tahmin alıyor — yüksek kritik recall bir “aşırı-uyarı rejimi” içinde elde ediliyor.

Kaynak: experiments/results/faz_b_robustness.json — FedProx; çubuk = doğruluk, çizgi = kritik recall; imleçte ort±std.

Confusion Matrix (FedProx)

Satır = gerçek sınıf, sütun = tahmin; hücreler ham sayımlar (renk satır-normalize). Kaynak: faz_b_confusion.json.

Tempo-Duyarlı Ödül Denemesi

Sonuç: tempo-duyarlı ödül, statik-ödül taban çizgisine göre iyileşme sağlamadı.

Yöntem: Dayanıklılık ve confusion-matrix sonuçları için eğitilmiş ajanlar yeniden eğitilmeden, yalnızca gözlemlere uygulanan seed'li bozulmalar altında yeniden değerlendirildi (üç değerlendirme seed'i). Tempo-duyarlı ödül denemesinde ise ayrı bir ajan 160 tur yeniden eğitilip statik-ödül ortamında değerlendirildi. Ham JSON'lar GitHub deposunda: cdsa-atm/experiments/results

Faz C — ε Taraması ve Entropi-Hedefli Keşif

Dürüstlük notu: ε taraması iki uçlu — ε=2.0 korumasız taban çizgisiyle örtüşüyor, ε=0.5 politikayı tek eyleme çökertiyor. 0.05 entropi bonusu beş eylemin tümünü geri kazandırıyor ancak kritik recall 0.927'den 0.878'e geriliyor — kapsam, recall pahasına geliyor.

Her konfigürasyon, 160 turluk ayrı bir FedProx yeniden eğitimidir (seed 42); değerler statik-ödül ortamındaki final değerlendirmedir. Revizyon-hazırlık malzemesi — tüm değerler koşu JSON'larından okunur.

Diferansiyel Mahremiyet — ε Taraması (FedProx+DP)

Kaynak: experiments/results/faz_c_dp_sweep.json — eğriler eğitim boyunca ort. ödül, tablo final değerler.

Entropi-Hedefli Keşif (FedProx)

Kaynak: experiments/results/faz_c_entropy.json — eğriler eğitim boyunca ort. ödül, tablo final değerler.

Faz D — Yem-Sinyal Testi ve Kapılı Keşif

Dürüstlük notu: Yem-sinyal testinde decoy atıfı %15.3 ile tekdüze payın (%25) altında kaldı; göreli yükseklik, neredeyse-sabit çıktılar üzerinde hesaplanan atıfların dağılmasını yansıtıyor. Kapılı keşifte (taban 0.90) recall korundu (0.928) ancak politika iki-eylemde kaldı — kapsam-recall sınırı bu ölçekte bağlayıcı.

Her iki deney 160 turluk ayrı FedProx yeniden eğitimidir (seed 42). Decoy testi gözleme eklenen 2 alakasız U(0,1) kanalın grup-Shapley atıfını ölçer; kapılı keşifte 0.05 entropi bonusu yalnız probe kritik-recall >= 0.90 iken aktiftir.

Yem-Sinyal (Decoy) Atıf Testi (FedProx)

Kaynak: experiments/results/faz_d_decoy.json — grup-Shapley payları eylem başına (decoy sütunu vurgulu); alt tablo final değerler.

Kapılı Keşif — Recall Tabanlı Entropi (FedProx)

Kaynak: experiments/results/faz_d_gated_entropy.json — çizgi probe kritik-recall, kesikli çizgi taban, gölgeli bölgeler kapının açık olduğu aralıklar.