Zum Inhalt springen
  1. Google DeepMind75

    Google führt zwei Gemini-Modelle für Sprachausgabe ein

    Google führt Gemini 3.8 Flash TTS für gestaltbare Stimmen und Flash-Lite TTS für grosse Audiomengen ein; beide wandeln Text in Sprache um. Laut Google unterstützen beide mehr als 100 Sprachen und werden für Entwickler über die Gemini-Schnittstelle und Google AI Studio bereitgestellt. Flash TTS kann mit einer 30 Sekunden langen Aufnahme und Einwilligungsprüfung Stimmen nachbilden; diese Funktion ist in Google AI Studio in der Schweiz nicht verfügbar.

    Grund für die Empfehlung: Für Schweizer Nutzer unterscheiden sich die Einsatzbereiche der Modelle und der Zugang zur Stimmnachbildung.

  1. Google DeepMind81

    Google DeepMind stellt Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vor

    Google DeepMind stellt Gemini 3.8 Live für skalierbare Sprachdialoge und Gemini 3.8 Live Extended Thinking für komplexe Aufgaben mit mehrstufigem Schlussfolgern vor. Gemini 3.8 Live verarbeitet visuelle Eingaben nahezu in Echtzeit und unterstützt Sprachwechsel zwischen 97 Sprachen während eines Gesprächs. Beide Modelle werden ab heute über die Gemini API und Google AI Studio bereitgestellt; für Unternehmen gibt es eine private Vorschau.

    Grund für die Empfehlung: Die Angaben zu Echtzeitdialog, Werkzeugaufrufen und gestaffelter Verfügbarkeit zeigen, welche Bausteine Google DeepMind für sprachgesteuerte Arbeitsabläufe anbietet.

Ende erreicht