Architettura Multi-Agent Resiliente: OpenClaw Orchestrator, Hermes Auditor, OmniRoute Gateway e le AI Locali (Mem0 & Sec-Sentinel)

// ARCHITECTURAL_CORE_SUMMARY

Nel panorama dell’Intelligenza Artificiale applicata alle infrastrutture reali, il modello a “singolo agente onnisciente” ha dimostrato rapidamente tutti i suoi limiti strutturali: allucinazioni incontrollate, fragilità operativa, rate-limit asfissianti e gravi rischi di sicurezza. Per superare questa barriera, la nostra infrastruttura adotta un’architettura distribuita a separazione dei compiti: OpenClaw orchestra ed esegue i compiti operativi; Hermes funge da revisore tecnico indipendente in sola lettura; OmniRoute governa il routing intelligente e il failover istantaneo tra decine di modelli cloud/frontier; mentre due AI on-premise dedicate presidiano la memoria a lungo termine (Mem0 con embeddings locali) e l’analisi forense di sicurezza non censurata (Sec-Sentinel).


⚡ I Numeri Chiave dell’Infrastruttura

100%
Tracciamento Audit & Log
0 ms
Downtime con Failover LLM
0 PII
Dati Sensibili Esposti al Cloud
Read-Only
Isolamento Ruolo Revisore (Hermes)

🗺️ Lo Schema Architetturale Completo

L’infrastruttura interconnette nodi fisici, container LXC su Proxmox VE e 2 VM Cloud (2 processori e 12GB RAM), garantendo resilienza, ridondanza e audit continuo.

Schema Architetturale OpenClaw, Hermes, OmniRoute e AI Locali

1. OpenClaw: L’Orchestratore Esecutivo

OpenClaw opera come il “braccio operativo” e il coordinatore principale del sistema, ospitato su un’istanza dedicata (10.100.1.15). Non è un semplice generatore di risposte testuali: è un runtime completo dotato di tool-calling deterministico, accesso a filesystem, gestione servizi di rete e capacità di delega multi-agente.

I Ruoli Specializzati

  • Global_Router: Il cervello direttivo. Riceve l’input dell’utente, consulta la gerarchia delle fonti e determina se elaborare direttamente la richiesta o delegarla al subagente di reparto più idoneo.
  • Sistemista: Coordina l’amministrazione sistemistica, integrandosi con Proxmox VE, OPNsense HA/CARP, il cluster di monitoraggio Zabbix 7.0 LTS e la gestione container via Arcane.
  • Media-Manager, CFO & Musicista: Agenti verticalizzati per compiti specifici (triage dati finanziari, elaborazione audio lossless con Lidarr, gestione media).

Filosofia “Audit-Ready”

In OpenClaw vige una regola categorica definita in AUDIT_EVENTS.md: ogni volta che un subagente esegue una mutazione infrastrutturale (CHANGE) o una rettifica (CORRECTION), l’azione non viene considerata conclusa finché non viene prodotta un’evidenza tangibile (exit code, diff, log persistito con hash) e notificata all’outbox locale.


2. Hermes: Il Revisore Tecnico Super-Partes

In qualsiasi sistema autonomo, far giudicare all’esecutore la bontà del proprio lavoro conduce inevitabilmente a punti ciechi. Hermes è l’agente specificamente introdotto per spezzare questa autoreferenzialità.

Isolamento in Sola Lettura

Hermes vive all’interno di un container LXC indipendente su Proxmox VE (10.100.1.14, Debian 13 Trixie). Per design architetturale:

  • Zero Permessi di Scrittura: Hermes non possiede credenziali di scrittura sui server di produzione o sulle configurazioni di rete.
  • Consultazione Evidenze: Analizza esclusivamente report strutturati, file di log e snapshot con hash crittografici.
  • Feedback Tracciato: Se rileva un’anomalia, non modifica il sistema direttamente; emette una richiesta di correzione formale destinata a OpenClaw.

Il Canale di Audit (FastAPI + HMAC-SHA256)

La comunicazione tra OpenClaw ed Hermes avviene tramite un canale autenticato e protetto:

  1. OpenClaw raccoglie il manifest delle azioni del task (richiesta, evidenze, comandi eseguiti, diff).
  2. Il client Python (tools/openclaw_audit_client.py) genera un payload JSON firmato con HMAC-SHA256 e corredato da timestamp anti-replay.
  3. Il servizio hermes-audit-receiver (porta 8644 dell’LXC) valida la firma crittografica, accoda il report ed esegue una doppia valutazione: deterministica e semantica con omniroute/hermes-review.
  4. Gli esiti codificati sono: approved, approved_with_notes, needs_correction, insufficient_evidence.
  5. In caso di rilievo, si attiva un ciclo di correzione automatica vincolato a un massimo di 2 round, evitando loop infiniti.

3. OmniRoute: Il Gateway Centrale per tutti i Modelli LLM

Tutte le richieste di inferenza linguistica generate da OpenClaw ed Hermes transitano obbligatoriamente attraverso OmniRoute, deployato sul nodo su VM Cloud (2 processori e 12GB RAM) (10.200.0.12:20128).

Profilo Virtuale Modelli Primari e Priorità Destinazione d’Uso
omniroute/openclaw Codestral → Copilot GPT-4.1 → Groq Qwen 3.6 27B → Copilot GPT-4o → Gemini Flash Runtime primario per task generici e operativi
omniroute/openclaw-smart Codestral → Copilot GPT-4.1 → Copilot GPT-4o → Groq GPT-OSS 120B → Nemotron Reasoning Compiti analitici, refactoring architetturale complesso
omniroute/openclaw-fast Copilot GPT-4o Mini → Groq Qwen 3.6 → Mistral Code → Gemini Flash Lite → Gemma 4 Routing preliminare, estrazione parametri, health check
omniroute/hermes-review Codestral → Copilot GPT-4.1 → Groq Qwen 3.6 → Gemini Flash → Fallback Cloud Audit e revisione log di Hermes (massima precisione tecnica)
omniroute/emergency Copilot Mini → Gemini Flash Lite → Groq OSS Ultima linea di difesa in caso di saturazione globale

4. Le 2 AI Locali: Sovranità del Dato e Sicurezza Senza Filtri

AI Locale 1: Mem0 e l’Indicizzazione Vettoriale Privata

Un agente operativo necessita di memoria: preferenze utente, topologie di rete, chiavi di lettura dei log e note sui servizi. Spedire ogni frammento di memoria a servizi cloud terzi rappresenta un inaccettabile leak di riservatezza.

  • Engine Locale: Istanza Ollama in esecuzione sulla seconda VM Cloud dedicata con 2 processori e 12GB RAM (10.200.0.13:11434).
  • Modello di Embedding: nomic-embed-text:latest, generatore di embedding a 768 dimensioni ad altissima precisione semantica.
  • Integrazione con OpenClaw: Tramite il plugin integrato openclaw-mem0, i fatti estratti dalle sessioni vengono persistiti nel database SQLite locale (/root/.mem0/history.db) e indicizzati nelle collezioni vettoriali Qdrant (opnsense_kb, zabbix_kb).

AI Locale 2: Sec-Sentinel (Arcane & Qwen3-8B Uncensored)

Di fronte a un payload SQL injection reale, un reverse shell o un exploit estratto dai log di Suricata o OPNsense, le API cloud spesso rifiutano l’analisi etichettandola come “contenuto malevolo”. Per superare questo limite è nato Sec-Sentinel, subagente specialistico del Sistemista:

  • Engine Locale: Runtime di inferenza locale Arcane su host LAN (192.168.20.9:8088/v1).
  • Modello Tecnico: Qwen3-8B-Uncensored (quantizzazione ottimizzata Qwen3-8B-Uncensor-v2.Q4_K_M.gguf).
  • Ispezione Forense Senza Censura: Analizza oggettivamente minacce e alert di Suricata, Graylog e firewall OPNsense, classificando severità, vettore e rimedio operativo.
  • Sanitizzazione Preventiva PII: Maschera password, token API e indirizzi IP privati con marcatori [REDACTED_*] prima che qualunque log o diagnostica esca dalla LAN.

5. Perché Questa Architettura Cambia le Regole del Gioco

  1. Immunità dal Vendor Lock-in: Con OmniRoute come gateway unificato, cambiare provider LLM richiede solo la modifica di una riga di configurazione, con zero impatto sul codice degli agenti.
  2. Garanzia di Qualità Ingegneristica: La separazione tra Esecutore (OpenClaw) e Revisore (Hermes) certifica ogni azione mutativa con riscontri oggettivi e verifica crittografica.
  3. Privacy e Riservatezza Totale: I vettori di memoria (Mem0) e l’analisi cruda della sicurezza (Sec-Sentinel) non toccano mai il cloud esterno, rimanendo blindati nella LAN.