Nel dibattito sulla qualità dei servizi di telecomunicazione, il Network Operations Center è spesso citato come elemento distintivo, ma raramente descritto nei suoi meccanismi reali. Un NOC H24 non è una sala presidiata: è un sistema operativo che integra telemetria, correlazione, procedure di risposta e reporting verificabile.
Osservabilità: vedere prima di reagire
Il monitoraggio moderno di una rete carrier non può basarsi solo su polling SNMP tradizionale. In Nexim Italia utilizziamo un modello a più livelli:
- Streaming telemetry (gNMI, gRPC) per metriche ad alta frequenza sugli apparati core e edge
- Flow analysis (NetFlow, IPFIX, sFlow) per visibilità sui pattern di traffico e detection di anomalie
- Sonde attive per misurare latenza, jitter e packet loss end-to-end sui path critici
- Log aggregation centralizzata con correlazione temporale tra layer diversi
Dal segnale all’incidente: correlazione e triage
Un allarme isolato ha valore limitato. La differenza operativa la fa la capacità di correlare eventi provenienti da fonti diverse — apparato, link, servizio applicativo, sonda cliente — e ricondurli a una causa comune. Questo riduce il rumore in sala NOC e accorcia il tempo di diagnosi.
SLA misurabili, non promessi
Uno SLA credibile deve essere strumentato. Le metriche che pubblichiamo per servizio includono:
- Uptime mensile calcolato su misurazioni continue
- MTTA (Mean Time To Acknowledge) — quanto impiega il NOC a prendere in carico l’evento
- MTTR (Mean Time To Restore) — tempo di ripristino del servizio
- Parametri di qualità (packet loss, jitter, latenza) sui path monitorati
Incident response: runbook e comunicazione
Ogni classe di guasto ha un runbook associato e una escalation matrix definita. La comunicazione al cliente segue finestre contrattuali documentate: notifica iniziale, aggiornamenti periodici, RFO (Reason For Outage) post-evento. Questo approccio è particolarmente rilevante per i servizi broadcast (SMPTE 2110, JPEG-XS, ContentHub dual-path fibra) e per i clienti in colocation TIER III/IV, dove il tempo di degrado ha impatti operativi immediati e misurabili.
Conclusione
Un NOC efficace non elimina i guasti: rende deterministico il tempo di reazione. È questa la differenza tra dichiarare uno SLA e poterlo dimostrare.