tech·nic

aktualisiert 03. Mai 2026

STP-Reconvergence-Storm durch einen flappenden Aggregation-Port

Wie ein UniFi USW-Aggregation den ganzen Stack lahmlegte, weil Port 7 am 25G-DAC nicht mochte. Diagnose-Schritte, Log-Auszüge, finaler Workaround.


Symptom: Im Homelab fielen sporadisch Verbindungen aus — Frigate verlor Kameras, Nextcloud-Sync stockte, mein Mac warf alle paar Minuten “Internetverbindung wiederhergestellt”-Notifications. Klassisch genug, dass ich erst dachte, es sei ein WAN-Problem. War es nicht. Die kurze Zusammenfassung vorweg: ein DAC-Kabel am USW-Aggregation Port 7 hat geflappt, das hat STP triggern lassen, und in einem Stack mit drei USW-Pro-Aggregation läuft STP-Reconvergence laut. Workaround war, das Kabel auf Port 5 zu hängen.

Setup

  • Core: UniFi USW-Pro-Aggregation (Modell 2022), 10G/25G SFP+
  • Distribution: Zwei USW-Aggregation als Etagen-Switches (Keller + Erdgeschoss)
  • Uplink: 25G-DAC-Kabel (FS.com, MikroTik-kompatibel zertifiziert) zwischen Core P7 ↔ Keller P1
  • STP: RSTP, Default-Settings, keine manuellen Root-Bridge-Priorities
  • VLAN-Struktur: 6 VLANs, alle trunked auf dem Uplink

Erste Diagnose: ist das überhaupt das Netz?

Schritt 1 war typisch: am Mac ping 1.1.1.1 im Terminal mitlaufen lassen. Sah ich Dropouts? Ja, alle 90–120 Sekunden ein Loss von 3–8 Sekunden.

Schritt 2: am Core-Switch in die UniFi-Console, Topology-View. Da fiel auf, dass das Aggregation-Symbol für den Keller-Switch im selben Intervall kurz rot wurde — also auch der UniFi-Controller sah den Switch zeitweise als down.

Das hat zwei Hypothesen rausgekickt: WAN-Problem (war’s nicht), Mac-WiFi-Problem (war’s nicht).

Logs anschauen

Auf dem Core via SSH:

ssh ubnt@10.0.0.1
show log | grep -i 'stp\|link\|port 7'

Spannender Auszug, anonymisiert:

[Apr 28 19:42:14] STP: Topology change detected on port 7
[Apr 28 19:42:14] STP: Port 7 transitioning to Discarding
[Apr 28 19:42:15] LINK: port 7 (25G-DAC) DOWN
[Apr 28 19:42:18] LINK: port 7 (25G-DAC) UP
[Apr 28 19:42:18] STP: Port 7 transitioning to Learning
[Apr 28 19:42:33] STP: Port 7 transitioning to Forwarding
[Apr 28 19:43:51] STP: Topology change detected on port 7
[Apr 28 19:43:51] STP: Port 7 transitioning to Discarding
[Apr 28 19:43:52] LINK: port 7 (25G-DAC) DOWN

Klares Muster. Der Link auf Port 7 ging alle 90 Sekunden für ein paar Sekunden runter, STP machte daraufhin seinen Job (Topology-Change → Reconvergence), und während der Reconvergence-Phase steht der ganze Uplink in den Keller.

Warum das so weh tut

In einem klassischen Switch-Stack mit RSTP ist die Reconvergence-Time bei ~3–5 Sekunden — schnell genug, dass die meisten Applikationen das überleben. Was bei mir reinhaut:

  • Nextcloud-Desktop-Client wirft 2.x bei kurzen TLS-Timeouts seinen WebDAV-Mount
  • Frigate verliert RTSP-Streams und braucht 30–60 Sekunden, bis es alle Kameras wieder hochfährt
  • mein Mac auf WLAN zeigt Auto-Reconnect-Spinner an der Top-Bar

Aggregiert wirken 3 Sekunden Link-Down also wie 60 Sekunden gefühlte Aussetzer.

Was es nicht war

Reflex 1: das DAC-Kabel ist defekt. Hab’s ausgetauscht (zweites baugleiches Kabel aus dem Ersatzpool). Selber Fehler, selbe Frequenz. Damit raus.

Reflex 2: der SFP+/25G-Port am Keller-Switch ist defekt. Hab den Uplink auf einen anderen Port am Keller-Switch geschwenkt (P2 statt P1), Kabel zurückgesteckt auf Core P7. Selber Fehler. Damit auch raus — der gemeinsame Nenner ist Core P7.

Reflex 3: Firmware-Bug. Habe geprüft, ob es bekannte Issues mit der aktuellen USW-Pro-Aggregation-Firmware gibt. Forum-Posts zeigen einzelne Fälle, aber keine reproduzierbaren Workarounds.

Was es war

Ich hab Core P7 gegen Core P5 getauscht. Symptom weg. Direkt, vollständig, und seit zwei Wochen stabil.

Was genau mit P7 nicht stimmt, weiß ich nicht. Die UniFi-Console zeigt für den Port keine Auffälligkeiten (keine Errors, keine Drops), die Hardware ist fünf Monate alt. Mein Verdacht: der SFP+-Cage von P7 hat ein elektrisches Problem, das nur bei 25G mit DAC sichtbar wird — auf 10G mit Twinax wäre es vielleicht im Toleranzbereich geblieben.

Was ich daraus mitnehme

  1. Bei STP-Sturm immer auf den physischen Port schauen, nicht nur auf das Kabel. Ich hatte zu lange beim DAC verharrt.
  2. show log auf Switches ist Gold wert. Die UniFi-Console-UI zeigt abstrahierte Events, die für die Wurzelursache zu grob sind.
  3. Aggregation-Stacks mit RSTP brauchen Pflege. Bei der nächsten Hardware-Erneuerung schaue ich mir MSTP oder Multi-Chassis-LAG mit Loop-Protect statt blanken STP genauer an.

Wenn dir das hier mal in den Kopf kommt: tausche zur Diagnose nicht das Kabel und nicht das Netzteil als erstes, sondern den Port am gleichen Switch. Spart eine Stunde.