Forschende verfolgen eine chinesische Flotte von KI-Agenten
Unabhängige Forschende verfolgen eine Flotte von KI-Agenten。
Unabhängige Forschende verfolgen eine Flotte von KI-Agenten。
Google Research veröffentlicht einen Workshopbericht über Datenschutz und Sicherheit bei KI-Agenten。
GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.
Eine Befragung von 300 Technologieverantwortlichen zeigt, dass fehlendes Unternehmenswissen den Einsatz von KI-Agenten bremst。
Import AI 475 beleuchtet, wann KI-Agentenschwärme Zeit sparen。
Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.
Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.
Autonome KI soll Unternehmen helfen, Daten, Prozesse und Mitarbeitende in Echtzeit zu verbinden。
ServiceNow CoreAI hat AutoSynthData entwickelt, um Schwächen von Unternehmensagenten in neue Trainingsaufgaben umzuwandeln. Das System vergleicht Fehler des Zielmodells mit Erfolgen eines stärkeren Modells und prüft, ob die erzeugten Aufgaben realistisch, lösbar und verlässlich bewertbar sind. Mit den Fortschritten des Zielmodells verschiebt sich der Schwerpunkt auf verbleibende Schwächen.
ProvenanceGuard prüft nach der Antwort eines MCP-Agenten, ob jede Aussage durch die angegebene Quelle gedeckt ist. In einem medizinischen Test erkannte das System 138 von 139 Aussagen。
Google Research stellt vier Forschungsansätze für die automatische Erzeugung längerer。
Google Research stellt mit ToolGrad ein Verfahren vor。
Import AI 472 behandelt eine DeepMind-Studie über schummelnde Mathematik-Agenten。
Import AI 470 behandelt Maschinenrechte, die automatische Erzeugung von Trainingsumgebungen mit SPADE und bessere GPU-Kernels mit Hawkeye. Eine METR-Analyse sieht starke Beschleunigung bei der Suche nach Sicherheitslücken, geringere Effekte in der Mathematik und keine messbare Beschleunigung der KI-Forschung. SPADE verbessert in Spielumgebungen den Durchschnittswert von Qwen3-30B-A3B-Instruct-2507 auf 58.3.
Das Forschungsframework ABBEL lässt LLMs ihren Wissensstand laufend aktualisieren。