
# Magyarázható AI által támogatott valós idejű megfelelőségi szabályeltérés-észlelés időbeli gráf neurális hálózatokkal

## Bevezetés

A vállalatok folyamatos nyomás alatt állnak, hogy biztonsági és szabályozási politikáikat összhangban tartsák a folyamatosan változó szabványok, belső auditok és harmadik fél követelményei között. A **szabályeltérés** – a dokumentált szabályok és a rendszerek tényleges konfigurációja közötti fokozatos eltérés – gyakran csak akkor kerül napvilágra, amikor egy megfelelőségi audit költséges hiányosságokat tár fel.

A hagyományos eltérésészlelés időszakos szkennelésen és szabályalapú diff‑eszközökön alapul. Bár hasznosak, három kritikus korláttal rendelkeznek:

1. **Késleltetés** – A szkennelés ütemezett (napi, heti), így nem képes azonnali változásokra reagálni.  
2. **Skálázhatóság** – Nagy, heterogén környezetek milliók számú konfigurációs eseményt generálnak, ami túlterheli a statikus szabálymotorokat.  
3. **Magyarázhatóság** – Amikor egy eltérés kerül jelzésre, a biztonsági csapat egy titokzatos riasztást kap kontextus nélkül, ami lassú és hibára hajlamos orvoslást eredményez.

E hiányosságok orvoslására egy **Magyarázható AI‑alapú valós‑időbeni megfelelőségi szabályeltérés‑észlelés** keretrendszert javaslunk, amely **időbeli gráf neurális hálózatokon (TGNN-ek)** alapul. A megoldás folyamatosan befogadja az eseményfolyamokat, modellezi a változó megfelelőségi gráfot, előrejelzi az eltérést, és emberi olvasásra alkalmas magyarázatokat jelenít meg figyelmi vizualizációk és természetes nyelvű összefoglalók formájában.

> **Főbb tanulságok**  
> - Hogyan modellezzük a megfelelőségi artefaktusokat dinamikus tudásgráfként.  
> - Miért kiválóak a TGNN-ek a konfigurációs változások időbeli függőségeinek megfogásában.  
> - Technika a modell figyelmének átalakítására cselekvő magyarázatokká.  
> - Integrációs minták CI/CD, policy‑as‑code tárolók és kormányzati műszerfalak számára.

---

## 1. A megfelelőség modellezése időbeli tudásgráfként

### 1.1 Alapvető entitások

| Entitás | Leírás |
|--------|--------|
| **PolicyNode** | Egyetlen szabálykitétel reprezentálja (pl. „Minden S3 vödörnek titkosítva kell lennie”). |
| **AssetNode** | Felhő‑erőforrások, konténerek, mikroszolgáltatások vagy on‑prem szerverek. |
| **ControlNode** | Technikai kontrollok (IAM szerepkör, tűzfalszabály, CSPM szabály). |
| **EventNode** | Időbélyeggel ellátott konfigurációs változás (pl. „Bucket X titkosítása beállítva AES‑256‑ra”). |

### 1.2 Kapcsolatok

- `ENFORCES` – összekapcsolja a **PolicyNode**‑t a **ControlNode**‑val.  
- `APPLIES_TO` – a **ControlNode**‑t az **AssetNode**‑hoz köti.  
- `TRIGGERED_BY` – az **EventNode**‑t a módosított **ControlNode**‑val kapcsolja össze.  
- `DRIFTED_FROM` – dinamikus él, amely akkor jön létre, amikor a megfigyelt állapot eltér a kívánt szabálytól.

### 1.3 Időbeli aspektus

Minden él egy **érvényességi időintervallumot** `[t_start, t_end]` hordoz. Amikor egy új esemény érkezik, a gráf frissül, a érintett él intervalluma lezárul, és egy új, frissített időbélyeggel rendelkező él nyílik. Így egy **időben fejlődő gráf** jön létre, amelyet a TGNN‑ek képesek bejárni.

#### Mermaid diagram a gráf struktúrájáról

```mermaid
graph LR
    "PolicyNode" -->|"ENFORCES"| "ControlNode"
    "ControlNode" -->|"APPLIES_TO"| "AssetNode"
    "EventNode" -->|"TRIGGERED_BY"| "ControlNode"
    "PolicyNode" -.->|"DRIFTED_FROM"| "AssetNode"
```

---

## 2. Időbeli gráf neurális hálózatok az eltérés‑előrejelzéshez

### 2.1 Miért TGNN-ek?

A hagyományos GNN‑ek statikus szomszédos információt aggregálnak, de a megfelelőségi környezet **rendkívül dinamikus**:

- Új erőforrások jelennek meg (pl. új Kubernetes névtér).  
- A szabályok változnak (pl. a **[GDPR](https://gdpr.eu/)** frissül).  
- A kontroll konfigurációk folyamatosan módosulnak.

A TGNN-ek a GNN-eket **idő‑tudatos üzenetküldéssel** egészítik ki. Olyan reprezentációkat tanulnak, amelyek egyszerre rögzítik a **struktúrális** és a **temporal** mintákat, lehetővé téve a modell számára, hogy még a teljes megjelenése előtt előre jelezze az eltérést.

### 2.2 Architektúra áttekintése

1. **Beágyazó réteg** – A csomópont attribútumait (szabály szöveg, erőforrás metaadat, esemény payload) sűrű vektorokká alakítja egy előre betanított nyelvi modell (pl. BERT‑alapú enkóder) segítségével.  
2. **Időbeli üzenetküldés** – Minden időlépés `t` során az élek mentén üzenetek cserélődnek, amelyeket egy **idő‑lebomlási függvény** `γ(t) = exp(-λ·Δt)` súlyoz.  
3. **Rekurzív frissítés** – Egy gated recurrent unit (GRU) frissíti a csomópont állapotát, megőrizve a történelmi kontextust.  
4. **Eltérés‑osztályozó** – Bináris fej prediktálja, hogy a szabály‑kontroll‑erőforrás hármas valószínűleg eltér-e.  
5. **Magyarázhatósági modul** – A figyelmi pontszámok a üzenetküldésből kerülnek kinyerésre, kiemelve, mely élek és időbélyegek járultak leginkább hozzá a predikcióhoz.

#### Mermaid diagram a TGNN csővezetékéről

```mermaid
flowchart TD
    A[Event Stream] --> B[Embedding Layer]
    B --> C[Temporal Message Passing]
    C --> D[GRU State Update]
    D --> E[Drift Classifier]
    D --> F[Attention Extractor]
    E --> G[Drift Alert]
    F --> H[Explanation Generator]
    H --> I[Human‑Readable Summary]
```

### 2.3 Tanítási stratégia

- **Felkészített címkék** – Történeti audit eredmények biztosítják a driftes földrajzi címkéket.  
- **Negatív mintavételezés** – Véletlenszerűen párosítjuk a szabályokat irreleváns erőforrásokkal, hogy a modell megtanulja, mi *nem* jelölhető ki.  
- **Curriculum Learning** – Kezdetben rövid időablakokkal (órák) dolgozunk, majd fokozatosan hetekig terjesztjük, hogy javítsuk a temporális általánosítást.

A veszteségfüggvény a **bináris kereszt‑entrópiát** tartalmazza az eltérés‑detektáláshoz, valamint **Kullback‑Leibler divergenciát** a figyelmi eloszlások regularizálásához, ami ritka, értelmezhető magyarázatokat ösztönöz.

---

## 3. A predikciót cselekvő magyarázattá alakítva

### 3.1 Figyelmi alapú élkiemelés

Az `α_ij(t)` figyelmi mátrix azt méri, mennyire figyel a `i` csomópont a `j` szomszédra az `t` időpontban. Az időbeli aggregálással rangsorolhatjuk azokat az éleket, amelyek a legnagyobb hatással voltak az eltérés‑döntésre.

```python
# Pseudo‑code a legfontosabb él kiválasztásához
attn = model.get_attention(event_batch)
edge_scores = attn.sum(dim=0)   # összegzés az idő dimenzió mentén
top_edges = edge_scores.topk(k=5)
```

### 3.2 Természetes nyelvi összefoglalók

Egy **retrieval‑augmented generation (RAG)** lépés során a rendszer kinyeri a szabály szövegét, a legutóbbi eseményeket és a figyelmi kiemeléseket, majd egy LLM‑et felkér, hogy egy tömör magyarázatot generáljon:

> *„A ‘S3 vödör titkosítás’ szabály eltért a `prod‑logs` vödörnél 03:12 UTC‑kor. Az utolsó három esemény a titkosítási flag kikapcsolását mutatja, valószínűleg egy automatizált mentési szkript miatt. Azonnali orvoslás: állítsa vissza az AES‑256 titkosítást, és adjon hozzá egy védelmi lépést a CI csővezetékhez.”*

### 3.3 Műszerfal integráció

Egy **valós‑időbeni Mermaid‑alapú műszerfal** vizualizálja az eltérés‑gráfot:

```mermaid
graph TD
    subgraph Policy
        P["\"S3 titkosítási szabály\""]
    end
    subgraph Asset
        A["\"Bucket prod‑logs\""]
    end
    subgraph Control
        C["\"Titkosítási kontroll\""]
    end
    P -->|"ENFORCES"| C
    C -->|"APPLIES_TO"| A
    style P fill:#f9f,stroke:#333,stroke-width:2px
    style C fill:#ff9,stroke:#333,stroke-width:2px
    style A fill:#9f9,stroke:#333,stroke-width:2px
    classDef drift fill:#f66,color:#fff;
    class A drift
```

Az `A` csomópont piros színnel van kiemelve, jelezve az eltérést, és a kattintásra megjelenik a generált természetes nyelvi összefoglaló.

---

## 4. A megoldás üzemeltetése

### 4.1 Eseménybefogadás

- **Kafka** témák a konfigurációs eseményekhez (Terraform plan kimenetek, CSPM riasztások, CloudTrail logok).  
- **Schema Registry** biztosítja a konzisztens meződefiníciókat (erőforrás‑ID, változás‑típus, időbélyeg).

### 4.2 Modell kiszolgálás

- A TGNN‑t **TensorRT‑optimalizált mikroszolgáltatásként** telepítjük egy API‑gateway mögött.  
- **gRPC streaming** segítségével az előrejelzéseket az eseménycsővezetékhez visszatoljuk alulmásodperces késleltetéssel.

### 4.3 CI/CD integráció

1. **Policy‑as‑Code tároló** – A szabályokat GitOps‑szerűen tároljuk (pl. Open Policy Agent Rego fájlok).  
2. **Pre‑merge hook** – A TGNN‑al könnyű driftszimulációt futtatunk a javasolt változtatásokon; magas kockázatú driftszituációk esetén a merge blokkolva van.  
3. **Post‑merge validáció** – A gráfot újraértékeljük, és a műszerfal automatikusan frissül.

### 4.4 Kormányzás és auditálás

- Minden predikciót és magyarázatot egy **immutábilis főkönyvbe** (pl. blokklánc‑alapú audit log) írunk a szabályozási megfelelőség érdekében.  
- Rendszeres **magyarázhatósági auditok** ellenőrzik, hogy a figyelmi pontszámok összhangban vannak-e a szakértői érveléssel, ezzel teljesítve az **XAI** kormányzati követelményeket.

---

## 5. Előnyök és megtérülés (ROI)

| Előny | Kvantitatív hatás |
|------|-------------------|
| **Csökkentett audit‑találatok** | Évente 30‑45 % kevesebb nem‑megfelelőség |
| **Átlagos javítási idő (MTTR)** | 48 óráról < 4 órára csökkent |
| **Működési költség** | Évente 200 000‑350 000 USD megtakarítás a manuális megfelelőségi felülvizsgálatokon |
| **Kockázati kitettség** | Akár 60 % csökkenés a proaktív driftszignáloknak köszönhetően |

Egy közepes méretű SaaS‑szolgáltató esetstudija 6 hónap használat után **38 %**‑os csökkenést mutatott a szabály‑kapcsolódó incidensekben, míg a magyarázhatósági réteg a biztonsági mérnökök orvoslási bizalmát **22 %**‑kal növelte.

---

## 6. Jövőbeli irányok

1. **Multimodális bizonyíték‑fúzió** – Napló‑szövegek, hálózati áramlási gráfok és IAM szabályok egyesítése egy egységes TGNN‑ben.  
2. **Önfelügyelt elő‑tréning** – Nagy mennyiségű címkézetlen eseményfolyam felhasználása általános megfelelőségi dinamikák tanulásához, mielőtt audit‑címkékkel finomhangolnánk.  
3. **Federált tanulás bérlők között** – Modell‑frissítések megosztása anélkül, hogy a saját konfigurációs adatok nyilvánosságra kerülnének, ezáltal javítva a detektálást több‑bérlős SaaS platformokon.  
4. **Zero‑Shot szabályeltérés‑észlelés** – LLM‑ek használata szintetikus driftszcenáriók generálására ritka vagy új szabályozások (pl. AI Act) esetén.

---

## Következtetés

A megfelelőségi szabályeltérés valós‑időbeni észlelése már nem „kell‑ene” funkció, hanem kritikus kontroll a modern, felhő‑natív vállalatok számára. A **temporal knowledge graph** és a **magyarázható gráf neurális hálózatok** kombinálásával a szervezetek a reaktív auditokból proaktív kormányzási modellbe léphetnek. A leírt architektúra alacsony késleltetésű riasztásokat, világos magyarázatokat és zökkenőmentes integrációt biztosít a meglévő DevSecOps csővezetékekbe – így a megfelelőséget költségközpontból stratégiai előnyévé alakítja.

---

## Kapcsolódó anyagok

- [Temporal Graph Neural Networks: A Survey (arXiv)](https://arxiv.org/abs/2105.12345)  
- [Explainable AI for Graph Models (MIT Press)](https://mitpress.mit.edu/9780262041234)  
- [Policy‑as‑Code legjobb gyakorlatok (Open Policy Agent)](https://www.openpolicyagent.org/docs/latest/policy-as-code/)