Zum Inhalt springen
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

  1. AWS Machine Learning Blog64

    AWS zeigt, wie sich Mietverträge anhand festgelegter Regeln prüfen lassen

    AWS zeigt an einem Beispiel mit künstlich erstellten Mietverträgen, wie Amazon Quick Fragen entgegennimmt und festgelegte Regeln über die Ergebnisse entscheiden. Die KI wählt eine vorgegebene Prüfung und erklärt das Ergebnis; das System zählt auch unklare und unlesbare Verträge, damit erfasste Verträge nicht unbemerkt fehlen. Das Beispiel belegt keine Prüfung echter Verträge; zudem zeigt die Zählung nur, ob alle zuvor erfassten Verträge berücksichtigt wurden.

    Grund für die Empfehlung: Bei vielen Verträgen ist entscheidend, wer die Prüfung vornimmt und ob fehlende oder unlesbare Unterlagen sichtbar bleiben.

  1. GitHub Blog · AI & ML61

    GitHub Security Lab Taskflow Agent automatisiert Fuzzing für C/C++-Projekte

    GitHub Security Lab stellt mit Fuzzing Taskflow eine automatisierte Fuzzing-Pipeline für C/C++-Projekte vor. Sie erstellt Test-Harnesses。

    Grund für die Empfehlung: Die Trennung von Entscheidungen des Agenten und Ausführung durch MCP-Werkzeuge zeigt einen konkreten Ansatz zur Automatisierung wiederkehrender Fuzzing-Arbeit.

Ende erreicht