Treibhaus

Was wir machen

Voice AI, die ein echtes Telefonat übersteht

Die meisten Voice-Demos scheitern beim ersten Mal, wenn jemand dazwischenredet, eine Postleitzahl nuschelt oder etwas fragt, das im Skript nicht vorkam. Wir bauen Agenten, die echte Anrufe auf einer echten Rufnummer annehmen. Sie heben ab, klären was der Anrufer will, erledigen es, und geben ab, wenn ein Mensch übernehmen sollte.

Was wir bauen

01

Abheben und verstehen, worum es geht

Der Agent nimmt ab, klärt wer anruft und was derjenige wirklich will, und erledigt es. Er muss standhalten, wenn jemand dazwischenredet, mitten im Satz die Meinung ändert oder mit "ja hören Sie, es geht um die Sache von Dienstag" anfängt.

02

Termine buchen, verschieben, absagen

Der Termin wird im Gespräch vereinbart, verschoben oder abgesagt und steht im Kalender, bevor aufgelegt wird. Nichts liegt in einem Postfach, das am Montag jemand abarbeitet. Kalender, Zahlungen und CRM haben wir schon in Produktivplattformen verdrahtet.

03

Antworten aus Ihren Unterlagen

Öffnungszeiten, Preise, was Sie behandeln und was nicht, was man zum ersten Termin mitbringt. Der Agent antwortet aus Ihren eigenen Dokumenten. Wenn etwas falsch ist, ändern Sie das Dokument und nicht den Prompt.

04

Übergabe, die den Faden hält

Wenn er aufhören soll, hört er auf. Er leitet an einen Menschen weiter, mit Transkript und allem bereits Geklärten, damit niemand von vorne anfängt. Außerhalb der Zeiten nimmt er eine Nachricht auf, die man auch lesen mag.

Wie es gebaut ist

Es gibt zwei Bauweisen. Eine Kaskade führt Sprache zu Text, dann ein Sprachmodell, dann wieder Sprache. Jede Stufe ist einzeln einsehbar und austauschbar. Ein einzelnes Speech-to-Speech-Modell nimmt Audio auf und gibt Audio aus. Das ist schneller und näher am Tonfall, dafür gibt es weniger einzusehen. Was passt, hängt davon ab, wie genau Sie steuern müssen, was gesagt wird.

Über das Gefühl eines echten Gesprächs entscheidet die Latenz. Ab etwa einer Sekunde Stille hört der Anrufer jemanden, der nicht zuhört. Also verteilen wir dieses Budget bewusst. Wo das Modell läuft, wie früh es zu sprechen beginnt, was es sagt, während es noch arbeitet.

Er muss außerdem Unterbrechungen aushalten. Menschen reden dazwischen, ändern mitten im Satz die Richtung und sagen das Wichtigste zuletzt. Ein Agent, der nur funktioniert, wenn der Anrufer wartet, ist eine Demo und keine Telefonleitung.

Was wir mitbringen

Konversationelle KI, bereits ausgeliefert

Wir haben ein KI-Avatar-Produkt für die Kundenberatung gebaut, bei dem das Gespräch selbst die ganze Aufgabe war.

KI in einem Gesundheitsprodukt

Wir haben eine plattformübergreifende Gesundheits-App mit personalisierten Empfehlungen gebaut. Dieselbe Branche, aus der die meisten kommen, die uns nach Voice fragen.

Agenten und Wissensbasen

Unsere eigene Plattform verwaltet große Wissensbasen und betreibt Agenten darauf, über mehrere Regionen. Sprache ist ein weiterer Kanal darauf.

Die unglamouröse Hälfte

Ein Agent nützt nur, wenn er Ihre Systeme erreicht. Wir haben Kalender, Zahlungen und CRM in Produktivplattformen gebracht, darunter eine HIPAA-konforme Plattform für Ärzte und Patienten und das Kundenportal einer Krankenversicherung. Diese Arbeit kam vor unserer KI-Arbeit. Deshalb werden Einwilligung, Aufzeichnungen und personenbezogene Daten hier sauber behandelt.

Wo wir arbeiten

Für den deutschen Markt arbeiten wir mit einer Partneragentur in Augsburg zusammen. Am meisten gebaut haben wir im Gesundheitsbereich. Drei bisherige Projekte waren Gesundheitsplattformen, eines davon eine KI-Gesundheits-App. Buchung, Absage und Datenschutzpflichten mussten wir also bereits richtig lösen.

Sprechen wir

Sagen Sie uns, was Ihr Telefon heute macht und was es können sollte.

Nachricht senden