---
title: "Sprachagenten, die wie Einheimische sprechen | CallWhiz AI"
description: "CallWhiz AI ist eine Voice-AI-Plattform, deren Agenten ein- und ausgehende Telefonate in 30+ Sprachen führen – Self-Service und Pay-as-you-go zum Start, und bei Bedarf in Ihrer eigenen Cloud oder On-Premise betreibbar."
url: "https://callwhiz.ai/de"
language: "de"
---


# Sprachagenten, die wie Einheimische sprechen.

CallWhiz AI ist eine Voice-AI-Plattform, deren Agenten ein- und ausgehende Telefonate in 30+ Sprachen führen – Self-Service und Pay-as-you-go zum Start, und bei Bedarf in Ihrer eigenen Cloud oder On-Premise betreibbar.

Agenten, die echte Telefonate annehmen und führen, in 30+ Sprachen. An einem Nachmittag gebaut, auf eine Nummer gelegt, pro Minute bezahlt. In unserer Cloud – oder in Ihrer, wenn die Audiodaten Ihr Netz nicht verlassen dürfen.

CallWhiz AI ist eine Voice-AI-Plattform für kleine und mittlere Teams, deren Telefonleitungen beantwortet und deren ausgehende Anrufe erledigt werden müssen. Die Agenten klingen wie ein Mensch, erledigen die Arbeit während des Gesprächs in Ihren eigenen Systemen und laufen auf der Telefonie, die Sie bereits haben – in unserer Cloud oder in Ihrer. CallWhiz AI ist keine Suite nur für Konzerne und ersetzt Ihre Telefonanlage nicht.

Ein- und ausgehend · 30+ Sprachen · Läuft auf Ihrer bestehenden Telefonie · Ihre Cloud oder unsere · Keine monatliche Bindung

## Es klingt wie ein Mensch, nicht wie ein Sprachmenü

Jede Antwort wird zum Hören geschrieben, nicht zum Lesen, und wie sie gesprochen wird, wird pro Antwort entschieden – nicht einmal pro Agent festgelegt.

- Spricht in kurzen, gesprochenen Sätzen: so lang, wie ein Mensch am Telefon tatsächlich spricht, nicht als vorgelesener Absatz.
- Wärme, Ruhe oder Dringlichkeit wird für jede Antwort gewählt und in die Stimme übertragen, damit die Art des Sprechens zum Gesagten passt.
- Natürliches Zögern und Bestätigungen dort, wo ein Mensch sie setzen würde, und nirgends sonst.
- Liest Zahlen, Daten, Codes und Beträge so vor, wie ein Mensch sie ausspricht, und wiederholt wichtige zur Bestätigung.
- Register, Höflichkeitsformen und Gesprächseinstiege folgen der gesprochenen Sprache, nicht einer Übersetzung englischer Formulierungen.

Die Sprechanweisung wird pro Antwort erzeugt und auf das abgebildet, was die gewählte Stimme tatsächlich leisten kann: Pausen, Emotion, Tempo oder eine gesprochene Stilvorgabe. Was die Engine nicht umsetzen kann, wird entfernt statt vorgelesen. Jeder Anruf wird anschließend auf Antwortlänge, Sprechtempo, wiederholte Sätze, Floskeln und Füllwörter bewertet; diese Werte stehen im Gesprächsprotokoll.

## Es weiß, wann es sprechen soll – und wann nicht

Unterbrechung und Gesprächsende werden daran erkannt, wie die Stimme des Anrufers tatsächlich ausklingt. Das macht aus einem Telefonat ein Gespräch.

- Unterbrechen Sie es mitten im Satz, hört es auf und hört zu – wie ein Mensch.
- Reden Sie dazwischen, tritt seine Stimme zurück, statt gegen Sie anzureden.
- Eine Pause mitten im Gedanken gilt als Pause, nicht als Ende Ihres Beitrags. Es wartet, statt über Ihr Satzende hinwegzureden.
- Wird ein Anruf still, meldet es sich einmal zurück und beendet das Gespräch sauber, statt eine leere Leitung zu halten.
- Verabschiedet sich der Anrufer, endet der Anruf dort. Kein letztes Wort nach dem Abschied.

Das Gesprächsende ist eine akustische Entscheidung – wie die Stimme ausklingt – und kein fester Stille-Timer oder eine Schlagwortliste; Zwischenrufe werden so gefiltert, dass ein einzelnes „mhm“ keinen Satz entgleisen lässt. Die Gesprächsführung ist speziell auf Telefonaudio abgestimmt, das sich völlig anders verhält als ein Laptop-Mikrofon.

## Es antwortet aus Ihren Unterlagen – und sagt, wenn es nicht kann

Laden Sie die Dokumente hoch, aus denen ein Agent antworten soll. Er antwortet daraus oder gibt zu, dass er es nicht weiß, statt etwas Plausibles zu erfinden.

- Preislisten, Richtlinien, Produktblätter, FAQs, Skripte: hochgeladen und im Gespräch genutzt.
- Antworten stützen sich auf die gefundene Textstelle, geben also das Dokument wieder und nicht das Allgemeinwissen des Modells.
- Deckt nichts im Material die Frage ab, sagt der Agent das und bietet einen nächsten Schritt an, statt zu raten.
- Produktnamen, Ortsnamen und Fachbegriffe können der Spracherkennung beigebracht werden, damit sie auch auf einer schlechten Leitung richtig verstanden werden.
- Wird ein Dokument aktualisiert, ändert sich, was der Agent sagt. Es gibt keinen Prompt umzuschreiben.

Die Suche läuft pro Gesprächsschritt und beginnt, während der Anrufer noch spricht, sodass das Ergebnis bereits vorliegt, wenn die Antwort formuliert wird. Ein Fehltreffer blockiert die Antwort hart, statt nur ein Hinweis zu sein – genau das verhindert eine selbstbewusste falsche Antwort.

## Es erinnert sich an das letzte Gespräch

Ist das Gedächtnis eingeschaltet, erkennt ein Agent einen wiederkehrenden Anrufer und macht dort weiter, wo der letzte Anruf endete.

- Erinnert sich daran, was der Anrufer wollte, wozu er zugestimmt hat oder was ihm zugesagt wurde.
- Schließt die Lücke „wie ich letztes Mal erwähnte …“, die automatisierte Anrufe wie einen Neustart wirken lässt.
- Standardmäßig aus und pro Agent aktivierbar, denn nicht jeder Anwendungsfall sollte sich an Anrufer erinnern.

## Es erledigt die Arbeit, nicht nur das Reden

Agenten rufen mitten im Gespräch Ihre Systeme auf – buchen, nachschlagen, aktualisieren, anlegen – und sprechen das Ergebnis aus.

- Buchen, verschieben und stornieren in einem echten Kalender, Zeitzonen inklusive.
- Einen Kunden nachschlagen, eine Bestellung oder einen Kontostand prüfen und mit dem antworten, was das System tatsächlich zurückgibt.
- Einen Datensatz im CRM anlegen oder aktualisieren, während das Gespräch noch läuft.
- Jede interne API kann einem Agenten als Aktion gegeben werden, samt der Worte, die er beim Warten sagen soll.
- Aktionen, die etwas verändern, können zuerst die gesprochene Bestätigung des Anrufers verlangen.

Jede Aktion wird dem Agenten mit eigenen Parametern und einer natürlichen „Ich schaue kurz nach …“-Zeile beschrieben, damit ein langsames Backend wie ein nachschauender Mensch klingt und nicht wie Stille. Sensible Aktionen liegen hinter einer Vorlesen-und-Bestätigen-Sperre.

## Es übergibt richtig an einen Menschen

Ein Anrufer erreicht jederzeit einen Menschen, und der Mensch kommt mit dem Kontext, statt den Anrufer von vorn beginnen zu lassen.

- Nach einer Person fragen, eine Taste drücken oder einfach so klingen, als wolle man eine: Alle drei leiten den Anruf weiter.
- Wer den Anruf übernimmt, weiß vorher, was der Anrufer wollte.
- Weiterleitung an einen Arbeitsplatz, ein Mobiltelefon oder eine Warteschlange.
- Anrufe, die in einer Übergabe enden, werden als solche markiert, damit Sie sehen, was Ihre Agenten übergeben und warum.

## Es spricht die Sprachen Ihrer Kunden

Ein Agent deckt 30+ Sprachen ab, mit Sprachwechsel mitten im Satz, statt einer eigenen Bereitstellung pro Markt.

- Anrufer wechseln mitten im Satz die Sprache, und der Agent folgt.
- Regionale Akzente und Dialekte werden innerhalb einer Sprache unterstützt, nicht zu einer Einheitsform eingeebnet.
- Eine Bibliothek von Stimmen zur Auswahl oder eine für Ihre Marke geklonte Stimme.
- Eine noch nicht abgedeckte Sprache kann ergänzt werden, in der Regel in drei bis vier Wochen.

Die Sprache der Antwort folgt dem Anrufer Gesprächsschritt für Gesprächsschritt; sie wird nicht zu Beginn des Anrufs festgelegt.

## Es läuft auf Ihren Telefonleitungen

Agenten verbinden sich per SIP mit der Telefonie, die Sie bereits haben. Ihre Telefonanlage wird nicht ersetzt.

- Verbindet sich per SIP mit Ihrer bestehenden Umgebung, einschließlich der großen Cloud- und On-Premise-Plattformen.
- Oder nehmen Sie eine Nummer von uns: Anrufziele in 180+ Ländern, Nummern in 20+ verfügbar.
- Ein- und ausgehend vom selben Agenten. Einmal gebaut, beide Richtungen.
- Bringen Sie Ihren eigenen Carrier-Vertrag mit, wenn Sie einen haben, und behalten Sie Ihre Tarife.
- Aufzeichnung, Transkripte und Routing pro Nummer inklusive.

Das eingehende Routing erfolgt pro Nummer: Ein Konto kann verschiedene Agenten auf verschiedenen Leitungen betreiben, und ein Agent lässt sich auf einer Nummer austauschen, ohne den Carrier anzufassen.

## Es ist nicht nur ein Telefonagent

Derselbe Agent antwortet im Web, auf WhatsApp und in Ihrer mobilen App – mit einem Satz Anweisungen und einem Wissensstand.

- Ein einbettbares Sprach-Widget für Ihre Website. Der Anrufer klickt und spricht.
- Die offizielle WhatsApp Business API, einschließlich Antwortmenüs zum Antippen, die Angaben ohne Umweg ausfüllen.
- Mobil: Einen Anruf auf das Telefon eines Kollegen leiten, wenn er verfügbar ist, und den Agenten übernehmen lassen, wenn nicht.

## Es macht die Anrufe, zu denen Sie nie kommen

Ausgehende Kampagnen aus einer Liste, einer Tabelle oder Ihrem CRM – mit Wiederholungen, Taktung und Ergebnissen pro Anruf, die zurückgeschrieben werden.

- Liste hochladen oder CRM anbinden; die Kampagne wählt, spricht und hält fest, was passiert ist.
- Fehlgeschlagene und unbeantwortete Anrufe werden nach eigenem Zeitplan wiederholt, statt verloren zu gehen.
- Ergebnisse und ausgelesene Felder werden in den Quelldatensatz zurückgeschrieben.
- Vorab aufgezeichnete Kampagnen mit eingefügten persönlichen Details, wo kein vollständiges Gespräch nötig ist.
- Eine Kampagne kann plattformweit sofort pausiert werden, auch Anrufe, die gerade klingeln.

## Es bleibt innerhalb der Regeln, die Sie setzen

Compliance ist eine Einstellung am Agenten, kein Absatz im Prompt, der hoffentlich befolgt wird.

- „Sag, dass du eine KI bist“: Ein Schalter, mit dem der Agent vor Beginn erklärt, dass er eine KI ist.
- Anrufzeiten pro Agent, in der Zeitzone des Kunden, durchgesetzt, bevor ein Anruf aufgebaut wird – nicht danach.
- Eine Tagesobergrenze pro Nummer, damit niemand aus Versehen fünfmal am Tag angerufen wird.
- Widerruf während des Gesprächs: Wer nicht mehr angerufen werden möchte, wird in dem Moment so vermerkt, in dem er es sagt.
- Sensible Angaben werden beim Sprechen geschützt: Lange Nummern und Einmalcodes werden maskiert statt vorgelesen, und vor jedem Kontodetail kann ein Identitätsnachweis verlangt werden.
- Fertige Regelpakete für regulierte Tätigkeiten, bei denen die strengeren Regeln fest verriegelt sind, statt der Konfiguration überlassen zu werden.
- Aufbewahrung und Löschung: Aufzeichnungen und Transkripte laufen nach Ihrem Zeitplan ab, und die Daten eines Anrufers können auf Wunsch gelöscht werden.
- Ein manipulationssicheres Protokoll darüber, wer was geändert hat.

Die Sperre sitzt zwischen Modell und Stimme, sodass ein Regelverstoß gestoppt wird, bevor er ausgesprochen ist, statt hinterher gemeldet zu werden. Untergrenzen in einem regulierten Paket lassen sich in der Konsole nicht lockern; dafür ist eine protokollierte Freigabe nötig.

## Sie können es testen, bevor Ihre Kunden es tun

Agenten werden wie Software gegen geschriebene Szenarien getestet, sodass eine Prompt-Änderung geprüft ist, bevor sie einen Anrufer erreicht.

- Ein Szenario schreiben – ein schwieriger Anrufer, eine Rückerstattungsforderung, ein Verwählter – und den Agenten dagegen laufen lassen.
- Einen echten Anruf, der schlecht lief, mit einem Klick in einen Testfall verwandeln.
- Zwei Versionen eines Agenten direkt vergleichen, bevor umgeschaltet wird.
- Ein wöchentlicher Verbesserungslauf schlägt Änderungen vor; eine Person nimmt jede an oder lehnt sie ab. Nichts schreibt sich selbst in die Produktion.

## Sie sehen genau, was in jedem Anruf passiert ist

Jeder Anruf hinterlässt ein vollständiges Protokoll: Aufzeichnung, Transkript, Ergebnis, wer ihn beendet hat und warum, was der Agent getan hat und wie er geklungen hat.

- Aufzeichnung und durchsuchbares Transkript.
- Ergebnis und Beendigungsgrund bei jedem Anruf: gelöst, weitergeleitet, Rückruf, abgebrochen, Widerruf.
- Die Aktionen, die der Agent ausgeführt hat, und was zurückkam.
- Eine Zusammenfassung nach dem Anruf, die das Gespräch zitiert, statt es zu paraphrasieren.
- Wie es geklungen hat: Sprechtempo, Antwortlänge, wiederholte Sätze, Füllwörter – damit aus „es klingt roboterhaft“ etwas wird, auf das Sie zeigen und das Sie beheben können.

## Einen zu bauen dauert einen Nachmittag

Beschreiben Sie die Aufgabe in normaler Sprache, und der Agent wird für Sie entworfen, Abschnitt für Abschnitt, mit markierten Lücken, bevor er live geht.

- Beschreiben Sie die Aufgabe; die Anweisungen werden für Sie geschrieben und dann von Ihnen bearbeitet.
- Ein Prüflauf fängt die Fehler ab, die zu schlechten Anrufen führen: fehlende Grenzen, ein Werkzeug, das der Agent gar nicht aufrufen kann, eine Regel, die dem Compliance-Paket widerspricht.
- Jede Version wird aufbewahrt, mit Angabe, wer sie wann geändert hat, und jede Version lässt sich wiederherstellen.
- Per Telefon oder im Browser testen, bevor es auch nur in die Nähe eines Kunden kommt.

## Entwickler bekommen das Ganze als API

Alles, was die Konsole kann, ist ein API-Aufruf, und jeder Anruf kann Ereignisse an Ihre Systeme senden.

- Agenten anlegen und verwalten, Anrufe auslösen und Gesprächsprotokolle programmatisch lesen.
- Web-SDK mit signierten Tokens und Domain-Freigabeliste für Anrufe aus dem Browser.
- Webhooks vor einem Anruf (um den Anrufer nachzuschlagen) und danach (um das Ergebnis abzulegen).
- Veröffentlichte OpenAPI-Beschreibung; Authentifizierung per Bearer-Token.

## Betreiben Sie es dort, wo Ihre Daten bleiben müssen

Dieselbe Plattform läuft als SaaS, in Ihrem eigenen Cloud-Konto oder auf Ihrer eigenen Hardware – mit denselben Funktionen in jedem Fall.

- SaaS: Registrieren und noch heute live sein.
- Ihre Cloud: Die Plattform in Ihrem eigenen AWS-, Azure- oder GCP-Konto, sodass Gesprächsaudio Ihre Grenze nie verlässt.
- On-Premise: Bare Metal oder Kubernetes, für Netze ganz ohne Cloud.
- SSO und rollenbasierte Zugriffe, Datenresidenz nach Region, Mandantenfähigkeit, 99,9 % Verfügbarkeits-SLA: verfügbar, wenn Sie sie brauchen, nicht nötig zum Start.
- In-Cloud- und On-Premise-Bereitstellungen werden zuerst abgestimmt und laufen dann in etwa 30 Tagen auf echten Anrufen.

## Preise, mit denen ein kleines Team starten kann

Pro Minute aus Guthaben (Credits), ohne Plattformgebühr, ohne Gebühr pro Nutzer und ohne monatliche Bindung.

- Ein Credit kostet 0,01 US-Dollar.
- Eine Minute mit Standardstimme kostet etwa fünf Credits; Premium-Stimmen etwa sieben; Echtzeitmodelle acht bis fünfzehn.
- Keine Plattformgebühr, keine Nutzerlizenzen, kein Minimum.
- Größere Bereitstellungen werden separat angeboten.

## Wo CallWhiz AI arbeitet

- [AI voice agents for businesses in the United States](https://callwhiz.ai/markets/united-states.md) (Englisch)
- [AI voice agents for UK businesses](https://callwhiz.ai/markets/united-kingdom.md) (Englisch)
- [KI-Sprachagenten in Europa: Sprachen, DSGVO und Datenresidenz](https://callwhiz.ai/de/markets/europe.md)
- [AI voice agents in the Middle East: Arabic and English, UAE and Saudi Arabia](https://callwhiz.ai/markets/middle-east.md) (Englisch)
- [AI voice agents in India: Hindi, English and regional languages](https://callwhiz.ai/markets/india.md) (Englisch)

## Häufige Fragen

**Muss ich mit dem Vertrieb sprechen?** Nein. Registrieren, einen Agenten bauen, auf eine Nummer legen, heute live sein. Ein Abstimmungsgespräch gibt es nur, wenn der Agent in Ihrer eigenen Infrastruktur laufen soll.

**Ist das nur etwas für große Unternehmen?** Nein. Die meisten Kunden sind kleine und mittlere Teams, die pro Minute zahlen. Die Kontrollen, die große Unternehmen brauchen, gibt es; zum Start sind sie nicht nötig.

**Ersetzt es meine Telefonanlage?** Nein. Es verbindet sich per SIP mit Ihrer bestehenden Telefonie. Sie behalten Ihre Nummern, Ihren Carrier und Ihre Einrichtung.

**Verlassen meine Gesprächsdaten mein Netz?** Das müssen sie nicht. Dieselbe Plattform läuft in Ihrem eigenen Cloud-Konto oder auf Ihrer eigenen Hardware.

**Voice AI klingt immer noch roboterhaft.** Unterbrechen Sie es, und es hört auf. Es spricht in gesprochenen Sätzen mit einer pro Antwort gewählten Sprechweise, und jeder Anruf wird auf das gemessen, was falsch klingt, damit es behoben werden kann.

**Was passiert, wenn es nicht antworten kann?** Es sagt das und übergibt an einen Menschen, mit dem Kontext. Es ist darauf gebaut, eine Lücke zuzugeben, statt eine Antwort zu erfinden.

**Wie wird es abgerechnet?** In Credits. Ein Credit ist ein US-Cent; eine Minute mit Standardstimme kostet etwa fünf. Sonst steht nichts auf der Rechnung.

**Versteht es Deutsch aus Österreich und der Schweiz?** Ja. Regionale Akzente und Dialekte werden innerhalb einer Sprache unterstützt, statt zu einer Einheitsform eingeebnet zu werden; Deutsch aus Deutschland, Österreich und der Schweiz gehört dazu. Wechselt ein Anrufer mitten im Satz ins Englische, folgt der Agent, weil die Sprache jeder Antwort Gesprächsschritt für Gesprächsschritt entschieden wird.

**Können Gesprächsdaten in meinem Land oder meiner Region bleiben?** Ja. Dieselbe Plattform läuft in Ihrem eigenen AWS-, Azure- oder GCP-Konto in der Region Ihrer Wahl, sodass Gesprächsaudio Ihre Grenze nie verlässt, oder auf Ihrer eigenen Hardware für Netze ganz ohne Cloud. Datenresidenz nach Region ist im gehosteten Dienst verfügbar, wenn Sie sie brauchen, und Aufbewahrung und Löschung laufen nach Ihrem Zeitplan.

**Sind die Preise je nach Land unterschiedlich?** Credits werden überall in US-Dollar berechnet. Ein Credit kostet 0,01 US-Dollar; eine Minute mit Standardstimme kostet etwa fünf Credits, Premium-Stimmen etwa sieben, Echtzeitmodelle acht bis fünfzehn. Keine Plattformgebühr, keine Nutzerlizenzen, kein Minimum; größere Bereitstellungen werden separat angeboten.

[Englische Website](https://callwhiz.ai/index.md)
