Datenschutz, kurz und ehrlich. Wir messen nur anonym, welche Seiten ankommen. Cookieless, ohne Werbe-Cookies, ohne Tracker, ohne Weiterverkauf. Du entscheidest, ob die Statistik mitläuft. Details in der Datenschutzerklärung.

    Glossar / Begriff

    Latenz, im AI-Kontext.

    Latenz ist die Zeit zwischen Anfrage und Antwort. Bei KI-Anwendungen entscheidet sie darüber, ob ein Assistent als schnell oder als defekt erlebt wird.

    Latenz ist die Verzögerung zwischen einer Anfrage und der Antwort des Systems. Bei KI-Anwendungen setzt sie sich aus mehreren Teilen zusammen: Netzwerkweg, Wartezeit beim Anbieter, Rechenzeit des Modells und die Zeit für vorgelagerte Schritte wie Suche in eigenen Dokumenten. Wichtig ist die Unterscheidung zwischen der Zeit bis zum ersten sichtbaren Zeichen und der Zeit bis zur vollständigen Antwort. Nutzer bewerten vor allem den ersten Wert, weshalb Streaming eine kurze wahrgenommene Wartezeit erzeugt. Für die Bewertung im Betrieb zählt nicht der Durchschnitt, sondern das langsame Ende der Verteilung. Dort entstehen Abbrüche, Doppelklicks und Supportfälle.

    Beispiele aus dem Mittelstand

    • Ein Kundenportal zeigt die Antwort des Assistenten im Stream an, damit die ersten Worte nach kurzer Zeit sichtbar sind.
    • Ein Fertigungsbetrieb verlagert die Dokumentensuche näher an das Modell und verkürzt so die Wartezeit vor der eigentlichen Antwort.
    • Ein Dienstleister misst die langsamsten fünf Prozent der Anfragen getrennt und findet dort einen überlasteten Zwischendienst.

    Folge-Fragen

    Welche Latenz ist bei einem Chat-Assistenten akzeptabel?

    Entscheidend ist die Zeit bis zum ersten sichtbaren Zeichen. Erscheint dort schnell etwas, wird auch eine längere Gesamtantwort akzeptiert.

    Warum reicht der Durchschnittswert nicht?

    Weil Ausreißer den Eindruck prägen. Ein guter Durchschnitt bei jeder zwanzigsten Anfrage über zehn Sekunden erzeugt trotzdem Frust.

    Was treibt Latenz bei RAG-Systemen?

    Die Kette aus Suche, Aufbereitung und Modellaufruf. Jeder Zwischenschritt addiert Zeit, deshalb lohnt eine Messung pro Schritt statt nur am Ende.

    Hilft ein kleineres Modell?

    Oft ja. Kleinere Modelle antworten schneller und reichen für einfache Aufgaben. Für komplexe Fälle bleibt das größere Modell im Einsatz.

    Latenz in der Praxis.

    Wo dieser Begriff in deinem Geschäft konkret wird, beginnt die Arbeit. Wir nennen klar, ob die Idee in unser Studio passt.

    Künstliche Intelligenz