Zum Inhalt springen
6. Okt.Di
5. Okt.Mo
  1. GitHub Blog · AI & ML59

    ReviewBench: Ein offener Benchmark für KI-Code-Reviews

    GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.

  2. AWS Machine Learning Blog46

    Agentische Suche mit LangChain und Amazon Bedrock Knowledge Bases

    Der AWS-Beitrag zeigt, wie eine RAG-Anwendung mit LangChain in Amazon Bedrock Knowledge Bases zwischen einfacher und agentischer Suche wählen kann. Die agentische Suche zerlegt mehrteilige Fragen in Teilabfragen, prüft die Belege und sucht bei Bedarf erneut. Ein Vergleich der Suchwege zeigt auch ihre Kosten und wann die günstigere Variante genügt.

  3. TechCrunch · AI65

    OpenAI führt Bildanzeigen neben ChatGPT-Bildergebnissen ein

    OpenAI führt visuelle Anzeigen ein, die neben von ChatGPT generierten Bildern erscheinen. Sie sollen später in diesem Monat zunächst nur in den USA für eine Testgruppe von Werbekunden starten. Laut OpenAI sind sie gekennzeichnet und beeinflussen die Antworten von ChatGPT nicht; zudem baut das Unternehmen seine Werbemessung und Prüfungen zur Markeneignung aus.

  4. MIT Technology Review · AI64

    Warum viele Menschen KI ablehnen und sie dennoch häufig nutzen

    Viele Menschen sehen KI kritisch, nutzen sie aber immer häufiger. Laut einer Gallup-Umfrage lehnten im Mai 71% der befragten Erwachsenen in den USA ein neues KI-Rechenzentrum in ihrer Umgebung ab; zugleich meldete ChatGPT laut Sensor Tower im Mai eine Milliarde monatliche Nutzer. Der Autor vermutet, dass sich die Ablehnung vor allem gegen den Druck der Unternehmen richtet, KI überall einzusetzen.

4. Okt.So
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

3. Okt.Sa
2. Okt.Fr
  1. AWS Machine Learning Blog64

    AWS zeigt, wie sich Mietverträge anhand festgelegter Regeln prüfen lassen

    AWS zeigt an einem Beispiel mit künstlich erstellten Mietverträgen, wie Amazon Quick Fragen entgegennimmt und festgelegte Regeln über die Ergebnisse entscheiden. Die KI wählt eine vorgegebene Prüfung und erklärt das Ergebnis; das System zählt auch unklare und unlesbare Verträge, damit erfasste Verträge nicht unbemerkt fehlen. Das Beispiel belegt keine Prüfung echter Verträge; zudem zeigt die Zählung nur, ob alle zuvor erfassten Verträge berücksichtigt wurden.

    Grund für die Empfehlung: Bei vielen Verträgen ist entscheidend, wer die Prüfung vornimmt und ob fehlende oder unlesbare Unterlagen sichtbar bleiben.

  2. MIT Technology Review · AI61

    Thore Graepel erklärt, warum LLMs seiner Ansicht nach nicht wirklich schlussfolgern

    Thore Graepel argumentiert, dass die Gedankenketten heutiger LLMs kein eigenständiges Schlussfolgerungsverfahren wie die Suche von AlphaGo bilden. Er verweist auf fehlende überprüfbare Wissenszustände und darauf, dass Modelle ihre Schlusswege teils erst nachträglich darstellen. Für verlässliche Ergebnisse fordert er Systeme, die Annahmen und Belege fortlaufend prüfen und aktualisieren.