CDSA-MRO

Bakım Emniyeti Sütunu — Motor + Siber + Bakım Füzyonu

Precomputed seeded CPU-scale runs (Faz A, June 2026) İnteraktif simülasyon — operasyonel değil

Faz A — Seed'li Referans Koşular

Not: Faz A metrikleri seed'li CPU-ölçek referans koşulardır. Tüm konfigürasyonların özdeş değerlere yakınsaması (43.7 / 0.499), Faz B'de gösterilen sabit-eylem politikasının sonucudur — görev hakimiyeti kanıtı olarak okunmamalıdır.

Öğrenme Eğrileri

Eğrilerin düz görünmesi bir görselleştirme hatası değildir — MRO görevinde tüm konfigürasyonlar ilk turlarda aynı sabit-eylem politikasına yakınsır ve bozulma koşulları metrikleri değiştirmez. Ayrıntı için Faz B dürüstlük notuna bakınız.

Kaynak: experiments/results/faz_a_curves.json (seed'li koşu, 11 Haziran 2026).

Konfigürasyon Karşılaştırması

Eğitilmiş Ajan Karar Örnekleri

Aksiyon dağılımı
Durum vektörü

Kaynak: experiments/results/sample_decisions.json — eğitilmiş FedProx ajanıyla seed'li inference örnekleri.

Faz B — Dayanıklılık ve Confusion-Matrix Analizi

Dürüstlük notu: Değerlendirilen politika tüm konfigürasyonlarda tek eyleme çöküyor — Faz A satırı görev hakimiyeti kanıtı değil, dejenere-politika sonucudur.

Eğrilerin düz görünmesi bir görselleştirme hatası değildir — MRO görevinde tüm konfigürasyonlar ilk turlarda aynı sabit-eylem politikasına yakınsır ve bozulma koşulları metrikleri değiştirmez. Ayrıntı için Faz B dürüstlük notuna bakınız.

Kaynak: experiments/results/faz_b_robustness.json — FedProx; çubuk = doğruluk, çizgi = kritik recall; imleçte ort±std.

Confusion Matrix (FedProx)

Satır = gerçek sınıf, sütun = tahmin; hücreler ham sayımlar (renk satır-normalize). Kaynak: faz_b_confusion.json.

Tempo-Duyarlı Ödül Denemesi

Sonuç: tempo-duyarlı ödül, statik-ödül taban çizgisine göre iyileşme sağlamadı.

Yöntem: Dayanıklılık ve confusion-matrix sonuçları için eğitilmiş ajanlar yeniden eğitilmeden, yalnızca gözlemlere uygulanan seed'li bozulmalar altında yeniden değerlendirildi (üç değerlendirme seed'i). Tempo-duyarlı ödül denemesinde ise ayrı bir ajan 160 tur yeniden eğitilip statik-ödül ortamında değerlendirildi. Ham JSON'lar GitHub deposunda: cdsa-mro/experiments/results

Faz C — ε Taraması ve Entropi-Hedefli Keşif

Dürüstlük notu: ε koşulları ve 0.01 entropi sabit-eylem politikasını değiştirmedi; 0.05 entropi bonusu tek-eylem çöküşünü ilk kez kırdı (beş eylemden ikisi, doğruluk %53.0, kritik recall 0.613) — kısmi ama gerçek bir iyileşme.

Her konfigürasyon, 160 turluk ayrı bir FedProx yeniden eğitimidir (seed 42); değerler statik-ödül ortamındaki final değerlendirmedir. Revizyon-hazırlık malzemesi — tüm değerler koşu JSON'larından okunur.

Diferansiyel Mahremiyet — ε Taraması (FedProx+DP)

Kaynak: experiments/results/faz_c_dp_sweep.json — eğriler eğitim boyunca ort. ödül, tablo final değerler.

Entropi-Hedefli Keşif (FedProx)

Kaynak: experiments/results/faz_c_entropy.json — eğriler eğitim boyunca ort. ödül, tablo final değerler.

Faz D — Yem-Sinyal Testi ve Kapılı Keşif

Dürüstlük notu: Sabit-eylem politikası Faz D'de de sürdü — kritik-recall tabanına (0.90) hiç ulaşılamadığı için keşif kapısı hiç açılmadı (gate_on 0.0). Decoy atıfı %11.1 (tekdüze pay %50'nin altında) ancak neredeyse-sabit çıktılar üzerinde okunmalı.

Her iki deney 160 turluk ayrı FedProx yeniden eğitimidir (seed 42). Decoy testi gözleme eklenen 2 alakasız U(0,1) kanalın grup-Shapley atıfını ölçer; kapılı keşifte 0.05 entropi bonusu yalnız probe kritik-recall >= 0.90 iken aktiftir.

Yem-Sinyal (Decoy) Atıf Testi (FedProx)

Kaynak: experiments/results/faz_d_decoy.json — grup-Shapley payları eylem başına (decoy sütunu vurgulu); alt tablo final değerler.

Kapılı Keşif — Recall Tabanlı Entropi (FedProx)

Kaynak: experiments/results/faz_d_gated_entropy.json — çizgi probe kritik-recall, kesikli çizgi taban, gölgeli bölgeler kapının açık olduğu aralıklar.