close notice

This article is also available in English. It was translated with technical assistance and editorially reviewed before publication.

Don’t show this again.

Google gibt seinen KI-Sprachagenten ein Gesicht. Mit „Live Avatar“ erweitert der Konzern sein Sprachmodell Gemini 3.8 Live für multimodale Sprachagenten um animierte Avatare, die sich nahezu in Echtzeit mit Nutzern unterhalten können. Sprache, Lippenbewegungen und Gesichtsausdruck werden dabei synchron erzeugt. Die Avatare können zudem verarbeiten, was ihnen Nutzer per Kamera oder Bildschirmfreigabe zeigen, und darauf im Gespräch reagieren.

Weiterlesen nach der Anzeige

Das System unterstützt 97 Sprachen und kann während eines Gesprächs automatisch zwischen ihnen wechseln. Lippenbewegungen und Gesichtsausdruck passen sich dabei an die jeweilige Sprache an. Auch wenn Nutzer dem Avatar ins Wort fallen, soll dieser den Gesprächskontext beibehalten. Parallel kann der Agent Tools und Schnittstellen aufrufen und etwa Daten abfragen oder Buchungsvorgänge ausführen, ohne das Gespräch zu unterbrechen. Google demonstriert das unter anderem bei einem Hotel-Check-in, bei dem der Avatar die Unterhaltung fortsetzt, während im Hintergrund Informationen abgerufen werden.

Live Avatar startet als Enterprise-Funktion

Live Avatar richtet sich vorerst ausschließlich an Unternehmen und ist ab sofort allgemein über Gemini Enterprise verfügbar. Dort können Kunden aus einer Bibliothek vorgefertigter Avatare mit unterschiedlichen Erscheinungsbildern, Stimmen und Ausdrucksweisen wählen. In einer Demonstration erstellt Google einen eigenen Avatar anhand eines Referenzfotos und einer Audioaufnahme. Dabei soll das System Ähnlichkeit, Markenstil oder Charakteridentität des Referenzbilds beibehalten können. Diese Möglichkeit ist nur nach Freischaltung und Verifikation durch Google verfügbar, um Identitätsmissbrauch zu verhindern. Sämtliche erzeugten Audio- und Videostreams versieht Google zudem mit seinem nicht wahrnehmbaren SynthID-Wasserzeichen.

Unternehmen können die Avatare auf Webseiten, Mobilgeräten und interaktiven Kiosken einsetzen. Google nennt als mögliche Anwendungen unter anderem digitale Concierges und den Kundenservice. Eine Verbraucherversion hat der Konzern bislang nicht angekündigt.

Grundlage für Live Avatar ist das erst vergangene Woche vorgestellte Gemini 3.8 Live. Das multimodale Modell ist auf Echtzeit-Sprachdialoge und Sprachagenten ausgelegt und verarbeitet unter anderem Audio-, Bild- und Videoeingaben. Im Speech-to-Speech Quality Index von Artificial Analysis erreicht die leistungsfähigere Extended-Thinking-Variante den ersten Platz mit 82,6 Punkten unter allen getesteten Modellen für Echtzeit-Sprachdialoge, Gemini 3.8 Live belegt Rang fünf.

(tobe)

Dieser Link ist leider nicht mehr gültig.

Links zu verschenkten Artikeln werden ungültig, wenn diese älter als 7 Tage sind oder zu oft aufgerufen wurden.


Sie benötigen ein heise+ Paket, um diesen Artikel zu lesen. Jetzt eine Woche unverbindlich testen – ohne Verpflichtung!