Zum Inhalt springen
6. Okt.Di
5. Okt.Mo
  1. GitHub Blog · AI & ML59

    ReviewBench: Ein offener Benchmark für KI-Code-Reviews

    GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.

4. Okt.So
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

2. Okt.Fr
  1. Hugging Face Blog47

    Wie AutoSynthData Trainingsdaten für Unternehmensagenten erzeugt

    ServiceNow CoreAI hat AutoSynthData entwickelt, um Schwächen von Unternehmensagenten in neue Trainingsaufgaben umzuwandeln. Das System vergleicht Fehler des Zielmodells mit Erfolgen eines stärkeren Modells und prüft, ob die erzeugten Aufgaben realistisch, lösbar und verlässlich bewertbar sind. Mit den Fortschritten des Zielmodells verschiebt sich der Schwerpunkt auf verbleibende Schwächen.

29. Sept.Di
25. Sept.Fr
11. Sept.Fr
7. Sept.Mo
24. Aug.Mo
  1. Import AI49

    Import AI 470: Maschinenrechte, SPADE-Trainingsumgebungen und GPU-Kernels mit Hawkeye

    Import AI 470 behandelt Maschinenrechte, die automatische Erzeugung von Trainingsumgebungen mit SPADE und bessere GPU-Kernels mit Hawkeye. Eine METR-Analyse sieht starke Beschleunigung bei der Suche nach Sicherheitslücken, geringere Effekte in der Mathematik und keine messbare Beschleunigung der KI-Forschung. SPADE verbessert in Spielumgebungen den Durchschnittswert von Qwen3-30B-A3B-Instruct-2507 auf 58.3.

26. JuliSo