Wie schnell reagiert der Service, wie lange dauert die Bearbeitung und wie viele Fälle schafft ein Team? Solche Fragen prägen seit Jahren die Steuerung von Serviceorganisationen. Wenn KI-Agenten Anfragen eigenständig bearbeiten und Fachkräfte bei anderen Fällen unterstützen, verändern sich jedoch die Abläufe hinter den Zahlen. Welche bisherigen Kennzahlen bleiben aussagekräftig – und welche neuen braucht es, um Qualität, Wirtschaftlichkeit und Risiken im Blick zu behalten?
Kennzahlen sind Wegweiser für Entscheidungen. In der ServiceToday haben wir uns 2021 und 2024 damit beschäftigt, welche Größen Serviceverantwortliche für wichtig halten. In beiden Auswertungen stand die Kundenzufriedenheit an erster Stelle. Zugleich zeigte das Update von 2024 eine Verschiebung: Die Average Handling Time (AHT), also die durchschnittliche Bearbeitungszeit, wurde deutlich weniger wichtig eingeschätzt als 2021. Daraus lässt sich noch kein KI-Effekt ablesen. Die Entwicklung bietet aber einen Anlass, genauer zu fragen, was eine Kennzahl über die Leistung einer Serviceorganisation tatsächlich verrät.
Nehmen wir eine technische Anfrage: Ein Kunde meldet eine Störung an einer Anlage. Ein KI-Agent prüft zunächst die Fehlerbeschreibung, gleicht sie mit der Dokumentation ab und fragt Betriebsdaten an. Anschließend übergibt er den Fall samt möglicher Ursachen an eine Servicetechnikerin, die eine Diagnose stellt und den nächsten Schritt mit dem Kunden abstimmt. Wie lang war hier die Bearbeitungszeit? Wie viele Fälle hat die Technikerin „geschafft“? Und wer hat das Problem beim ersten Kontakt gelöst?
Die klassischen Kennzahlen sind damit nicht wertlos. Eine hohe First Time Fix Rate bleibt im technischen Außendienst bedeutsam, weil zusätzliche Anfahrten Zeit und Geld kosten. Auch eine lange Wartezeit fällt Kunden auf, unabhängig davon, ob hinter dem Service ein Mensch oder ein KI-Agent steht. Schwieriger wird es, wenn Kennzahlen, die vor allem menschliche Arbeit abbilden, zur alleinigen Bewertung eines gemeinsamen Arbeitsprozesses werden. Eine kürzere AHT kann bedeuten, dass KI sinnvoll unterstützt. Sie kann ebenso bedeuten, dass schwierige Fälle zu früh abgeschlossen werden. Eine niedrige Auslastung der Fachkräfte kann freie Kapazität anzeigen – oder den erwünschten Effekt, dass Routineanfragen bereits gelöst sind.
Es braucht deshalb einen Blick auf das gesamte Mensch-Maschinen-System: auf KI-Agenten, Mitarbeitende, Wissensbestände, Übergaben und die Ergebnisse für Kunden. Vier Kennzahlen können dabei helfen.
Der Automatisierungsgrad zeigt, welcher Anteil geeigneter Servicefälle ohne menschliche Bearbeitung abgeschlossen wird. Entscheidend ist das Wort „abgeschlossen“: Eine automatisch versendete Antwort ist noch keine Lösung. Als autonom gelöst sollte ein Fall erst gelten, wenn das Anliegen tatsächlich erledigt ist und nicht kurz darauf wegen desselben Problems erneut geöffnet wird. Steigt der Wert bei gleichbleibender Qualität, kann das auf funktionierende Automatisierung hinweisen. Stagniert er, lohnt sich ein Blick auf Wissenslücken, technische Grenzen oder veränderte Anfragen. Ein möglichst hoher Wert ist allerdings kein sinnvolles Ziel für jeden Falltyp. Bei sicherheitskritischen Entscheidungen oder komplexen Störungen kann die frühe Beteiligung eines Menschen genau der richtige Prozess sein.
Die Human-Handover-Rate erfasst, wie häufig KI-Agenten an Fachkräfte übergeben – und vor allem, bei welchen Anliegen und aus welchem Grund. Fehlen Informationen? Ist die Anfrage mehrdeutig? Überschreitet sie eine festgelegte Risikoschwelle? Eine hohe Übergabequote kann auf Lücken im verfügbaren Wissen hinweisen. Sie kann aber ebenso zeigen, dass die vorgesehenen Grenzen der Automatisierung eingehalten werden. Umgekehrt ist eine niedrige Quote nur dann erfreulich, wenn Fälle mit menschlichem Prüfbedarf zuverlässig erkannt werden. Für die Steuerung ist daher wichtiger als eine Gesamtzahl, ob Übergaben an den richtigen Stellen stattfinden und die Fachkräfte genügend Kontext erhalten, um ohne erneute Diagnose weiterzuarbeiten.
Die Knowledge-Decay-Rate soll sichtbar machen, wo verwendetes Servicewissen seine Gültigkeit verliert. Ein praktikabler Ausgangspunkt ist der Anteil der eingesetzten Antworten oder Lösungswege, die später als überholt oder unzutreffend erkannt werden. Gerade im technischen Service können Produktänderungen, neue Softwarestände und veränderte Ersatzteile bisher korrekte Anleitungen entwerten. Die Kennzahl funktioniert allerdings nur, wenn Mitarbeitende und Kunden Fehler zurückmelden können und diese Rückmeldungen geprüft werden. Sie misst dann zunächst erkannte Wissensfehler – nicht sämtliche Fehler im System. Trotzdem kann sie früher als eine allgemeine Zufriedenheitsbefragung anzeigen, wo Inhalte überprüft werden müssen.
Die Kosten pro gelöster Anfrage richten den Blick auf das Ergebnis statt auf einzelne Arbeitsstunden oder Kontakte. In die Rechnung gehören die Aufwände für Mitarbeitende ebenso wie Kosten für KI-Nutzung, Integration, Pflege der Wissensbasis, Qualitätskontrolle und Betrieb. Der Nenner muss sauber definiert sein: Ein Fall, der nach einer vermeintlichen Lösung erneut beim Service landet, darf die Bilanz nicht künstlich verbessern. Auch diese Kennzahl sollte nach Falltypen betrachtet werden. Die Behebung einer komplexen Anlagenstörung kostet mehr als eine einfache Auskunft. Ob der Aufwand angemessen war, lässt sich nur zusammen mit der Lösungsqualität beurteilen.
Damit rücken bisherige Kennzahlen in eine neue Rolle. Kundenzufriedenheit, Customer Effort Score und erneute Kontaktaufnahmen bleiben unverzichtbar, weil sie zeigen, was beim Kunden ankommt. First Time Fix Rate, Anlagenverfügbarkeit oder Reparaturzeit behalten dort Gewicht, wo sie den technischen Erfolg beschreiben. Automatisierungsgrad und Übergabequote erklären dagegen stärker, wie das gemeinsame System arbeitet. Die eine Gruppe kann die andere nicht ersetzen: Sinkende Kosten pro Fall wären ein schlechter Erfolg, wenn gleichzeitig mehr Störungen offenbleiben oder Kunden ihre Anliegen mehrfach schildern müssen.
Mit KI verändert sich außerdem der Takt der Steuerung. Wer täglich viele Anfragen automatisiert bearbeitet, erfährt aus einem Monatsbericht oft erst spät, dass eine neue Antwortvorlage fehlerhaft ist oder Übergaben bei einem bestimmten Störungstyp ausbleiben. Für solche Signale braucht es eine laufende, im Servicealltag nutzbare Auswertung: etwa tägliche Sichtungen und festgelegte Schwellen, bei denen Verantwortliche einen Falltyp prüfen, Wissen korrigieren oder eine Automatisierung vorübergehend begrenzen. Welche Schwelle sinnvoll ist, hängt vom Risiko des jeweiligen Prozesses ab. Eine falsche Auskunft zu einem Liefertermin verlangt eine andere Reaktion als eine fehlerhafte Empfehlung zur Arbeit an einer Anlage.
Der eigentliche Fortschritt liegt deshalb nicht in einem Dashboard mit möglichst vielen neuen Zahlen. Er liegt darin, aus den Zahlen konkrete Handlungen abzuleiten: Welche Anfragen kann die KI zuverlässig lösen? Wo braucht sie besseres Wissen? Wann muss ein Mensch übernehmen? Und verbessert das Zusammenspiel den Service für Kunden tatsächlich? Wer diese Fragen regelmäßig beantwortet, misst nicht nur, wie beschäftigt Menschen und Maschinen sind. Er erkennt, ob die Serviceorganisation ihre Aufgabe erfüllt.
Carsten Neugrodda, KVD Geschäftsführer