Zum Inhalt springen
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

  1. GitHub Blog · AI & ML61

    GitHub Security Lab Taskflow Agent automatisiert Fuzzing für C/C++-Projekte

    GitHub Security Lab stellt mit Fuzzing Taskflow eine automatisierte Fuzzing-Pipeline für C/C++-Projekte vor. Sie erstellt Test-Harnesses。

    Grund für die Empfehlung: Die Trennung von Entscheidungen des Agenten und Ausführung durch MCP-Werkzeuge zeigt einen konkreten Ansatz zur Automatisierung wiederkehrender Fuzzing-Arbeit.

  1. GitHub Blog · AI & ML74

    GitHub migriert die Copilot-Laufzeit mit Copilot von TypeScript nach Rust

    GitHub hat die Copilot-Agentenlaufzeit mithilfe der Copilot-App und der CLI von TypeScript nach Rust migriert. Laut dem beteiligten Entwickler schrieben AI-Agenten den Grossteil der mehr als 800,000 Zeilen produktiven Rust-Codes; die Änderungen wurden über 128 Pull Requests schrittweise integriert. Die neue Laufzeit kann über eine C-ABI auch direkt in Anwendungen der sechs Copilot-SDK-Sprachen eingebettet werden; dieser Betriebsmodus ist derzeit optional.

    Grund für die Empfehlung: Die schrittweise Migration zeigt, wie sich umfangreiche Änderungen bei laufender Entwicklung mit Tests und gestaffelten Releases absichern lassen.

  1. Mistral AI65

    Wie Mistral AI komplexen Fortran-Altcode mit AI-Agenten modernisiert

    Mistral AI beschreibt die Migration von 40,000 Zeilen Fortran 77 eines Reservoirsimulators nach C++ mithilfe von AI-Agenten. Zuerst entstand ein Testsystem für numerische Übereinstimmung。

    Grund für die Empfehlung: Der Vergleich von drei Agenten-Workflows zeigt, weshalb numerische Vergleichstests und menschliche Freigaben bei dieser Fortran-Migration zentral waren.

  1. Mistral AI62

    Mistral stellt Agentic Search für die Suche in komplexen Dokumenten vor

    Mistral stellt Agentic Search als Suchschicht vor, mit der KI-Systeme Informationen in komplexen Dokumenten suchen。

    Grund für die Empfehlung: Der Vergleich mit einmaligem RAG zeigt, wann die Navigation in langen Dokumenten und über mehrere Quellen hinweg die Suche verbessert.

Ende erreicht