Zum Inhalt springen
Trend-EreignisseUnter Beobachtung

GitHub startet ReviewBench für KI-Code-Reviews

1 Berichte1 Berichtsquellenvor 1 TagenAktualisieren

Das Wichtigste zuerst

KI-Überblick

GitHub hat ReviewBench als offenen Benchmark für KI-Agenten zur Codeprüfung vorgestellt. Eine Forschungsvorschau ist verfügbar: Nutzer können Agenten vergleichen und eigene Agenten mit einem Container-Image, ihrer Konfiguration und einem eigenen Modellschlüssel testen. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories in 19 Programmiersprachen. Laut GitHub stimmten erfahrene Ingenieure bei einer unabhängigen Prüfung der Befunde zu 96,6 Prozent mit ReviewBench überein. Eingereichte Ergebnisse bleiben bis zur Freigabe durch einen Maintainer privat und erscheinen nur beim ersten Eintrag eines Agenten oder wenn sie dessen bisherigen Bestenlistenwert übertreffen.

KI-generiert aus Berichten · aktualisiert vor 4 Stunden

Berichtsverlauf

Entdecken Sie verschiedene Seiten des Ereignisses anhand der Berichte.

5. Okt.
  1. GitHub Blog · AI & ML
    ReviewBench: Ein offener Benchmark für KI-Code-Reviews

    GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.

Trendverlauf dieses Ereignisses

Noch nicht genügend durchgehende Beobachtungsdaten für einen Trend.