Zum Inhalt springen

Technologiebereiche

Multimodalität Neueste Entwicklungen

Fähigkeiten über Text hinaus: Fortschritte bei Modellen und Produkten für Bildverständnis, kombinierte Bild- und Texteingaben sowie Audio- und Videoein- und -ausgabe.

4 Beiträge in der AuswahlLetzte 30 Tage 4 EinträgeInsgesamt erfasst: 13 Einträge

Aktualisieren

Auswahl zu Multimodalität

Heute6. Okt.DiNr. 1–4 Einträge
29. Sept.Di
  1. Microsoft Research63

    Microsoft Research stellt das KI-Forschungssystem Quine für die Biologie vor

    Microsoft Research stellt Quine vor, ein experimentelles Forschungssystem mit einem multimodalen Weltmodell der Biologie und einer Verbindung zu wissenschaftlichen Werkzeugen。

    Grund für die Empfehlung: Die Verbindung von Modellvorhersagen und Labortests zeigt am Beispiel von Bauchspeicheldrüsenkrebs, wie Quine die Auswahl von Wirkstoffen für weitere Versuche unterstützt.

25. Sept.Fr
  1. Google DeepMind62

    Google DeepMind stellt Gemini 3.8 Live mit Live Avatar vor

    Google DeepMind stellt Gemini 3.8 Live mit Live Avatar für visuelle Gespräche nahezu in Echtzeit vor. Die Funktion verbindet Sprache und Video。

    Grund für die Empfehlung: Die Kombination aus laufendem Dialog und Video zeigt, wie Unternehmen virtuelle Gesprächspartner einsetzen können, ohne die Unterhaltung bei Datenabfragen zu unterbrechen.

16. Sept.Mi
  1. Google DeepMind81

    Google DeepMind stellt Gemini 3.8 Live und Gemini 3.8 Live Extended Thinking vor

    Google DeepMind stellt Gemini 3.8 Live für skalierbare Sprachdialoge und Gemini 3.8 Live Extended Thinking für komplexe Aufgaben mit mehrstufigem Schlussfolgern vor. Gemini 3.8 Live verarbeitet visuelle Eingaben nahezu in Echtzeit und unterstützt Sprachwechsel zwischen 97 Sprachen während eines Gesprächs. Beide Modelle werden ab heute über die Gemini API und Google AI Studio bereitgestellt; für Unternehmen gibt es eine private Vorschau.

    Grund für die Empfehlung: Die Angaben zu Echtzeitdialog, Werkzeugaufrufen und gestaffelter Verfügbarkeit zeigen, welche Bausteine Google DeepMind für sprachgesteuerte Arbeitsabläufe anbietet.