Zum Inhalt springen
Heute7. Okt.Mi2 Einträge
  1. Microsoft Research52

    Microsoft-Forscherin Jennifer Neville erklärt Fehler von KI in längeren Gesprächen

    Microsoft-Forscherin Jennifer Neville beschreibt, warum KI-Systeme bei längeren Gesprächen und wiederholten Änderungen an Dokumenten Fehler machen können. In Tests ihrer Gruppe sank die Leistung deutlich, wenn Nutzer ihre Anforderungen erst über mehrere Gesprächsschritte erklärten. Sie rät dazu, Antworten zu prüfen und bei Verwirrung die Aufgabe in einem neuen Gespräch vollständig zu formulieren.

  2. AWS Machine Learning Blog46

    Anleitung: Sprachassistent für Flugreisen mit Amazon Bedrock AgentCore und Nova Sonic bauen

    Der AWS Machine Learning Blog zeigt, wie sich ein Sprachassistent für Flugreisen mit Amazon Bedrock AgentCore und Amazon Nova 2.5 Sonic in eine Airline-Anwendung einbauen lässt. Reisende können per Sprache Flugdaten abrufen, Sitzplätze ändern oder Fragen zu Airline-Regeln stellen. Die gezeigte Anbindung nutzt Beispieldaten; für den Einsatz mit echten Buchungen muss sie an die Systeme der Airline angepasst werden.

6. Okt.Di
  1. AWS Machine Learning Blog47

    GLM 5.3 ist auf Amazon Bedrock verfügbar

    Das Modell GLM 5.3 von Z.ai ist für berechtigte Unternehmenskunden auf Amazon Bedrock verfügbar. Das 753B-Parameter-MoE-Modell ist auf Programmierung und längerfristige Aufgaben von AI-Agenten ausgelegt. Der Zugriff erfolgt über verwaltete APIs; Prompt-Caching und regionsübergreifende Inferenz werden unterstützt.

  2. AWS Machine Learning Blog42

    Anleitung: Claude Code mit Amazon Bedrock für regulierte Workloads nutzen

    Der AWS-Beitrag erklärt, wie sich Claude Code mit Amazon Bedrock in AWS GovCloud (US) für KI-gestützte Entwicklungsabläufe bei regulierten Workloads einrichten lässt. Er beschreibt Voraussetzungen, Konfiguration und Prüfung sowie die verfügbaren Claude-Modelle und Bedrock-Endpunkte. Organisationen müssen die Lösung an ihren eigenen Compliance-Anforderungen messen.

5. Okt.Mo
  1. GitHub Blog · AI & ML59

    ReviewBench: Ein offener Benchmark für KI-Code-Reviews

    GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.

  2. AWS Machine Learning Blog46

    Agentische Suche mit LangChain und Amazon Bedrock Knowledge Bases

    Der AWS-Beitrag zeigt, wie eine RAG-Anwendung mit LangChain in Amazon Bedrock Knowledge Bases zwischen einfacher und agentischer Suche wählen kann. Die agentische Suche zerlegt mehrteilige Fragen in Teilabfragen, prüft die Belege und sucht bei Bedarf erneut. Ein Vergleich der Suchwege zeigt auch ihre Kosten und wann die günstigere Variante genügt.

4. Okt.So
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

2. Okt.Fr
  1. Hugging Face Blog47

    Wie AutoSynthData Trainingsdaten für Unternehmensagenten erzeugt

    ServiceNow CoreAI hat AutoSynthData entwickelt, um Schwächen von Unternehmensagenten in neue Trainingsaufgaben umzuwandeln. Das System vergleicht Fehler des Zielmodells mit Erfolgen eines stärkeren Modells und prüft, ob die erzeugten Aufgaben realistisch, lösbar und verlässlich bewertbar sind. Mit den Fortschritten des Zielmodells verschiebt sich der Schwerpunkt auf verbleibende Schwächen.

30. Sept.Mi
29. Sept.Di
28. Sept.Mo
26. Sept.Sa
25. Sept.Fr
17. Sept.Do
  1. GitHub Blog · AI & ML74

    GitHub migriert die Copilot-Laufzeit mit Copilot von TypeScript nach Rust

    GitHub hat die Copilot-Agentenlaufzeit mithilfe der Copilot-App und der CLI von TypeScript nach Rust migriert. Laut dem beteiligten Entwickler schrieben AI-Agenten den Grossteil der mehr als 800,000 Zeilen produktiven Rust-Codes; die Änderungen wurden über 128 Pull Requests schrittweise integriert. Die neue Laufzeit kann über eine C-ABI auch direkt in Anwendungen der sechs Copilot-SDK-Sprachen eingebettet werden; dieser Betriebsmodus ist derzeit optional.

    Grund für die Empfehlung: Die schrittweise Migration zeigt, wie sich umfangreiche Änderungen bei laufender Entwicklung mit Tests und gestaffelten Releases absichern lassen.

11. Sept.Fr
9. Sept.Mi
  1. Mistral AI65

    Wie Mistral AI komplexen Fortran-Altcode mit AI-Agenten modernisiert

    Mistral AI beschreibt die Migration von 40,000 Zeilen Fortran 77 eines Reservoirsimulators nach C++ mithilfe von AI-Agenten. Zuerst entstand ein Testsystem für numerische Übereinstimmung。

    Grund für die Empfehlung: Der Vergleich von drei Agenten-Workflows zeigt, weshalb numerische Vergleichstests und menschliche Freigaben bei dieser Fortran-Migration zentral waren.

20. Aug.Do
26. JuliSo
7. JuliDi