Zum Inhalt springen
Heute6. Okt.Di7 Einträge
  1. AWS Machine Learning Blog47

    GLM 5.3 ist auf Amazon Bedrock verfügbar

    Das Modell GLM 5.3 von Z.ai ist für berechtigte Unternehmenskunden auf Amazon Bedrock verfügbar. Das 753B-Parameter-MoE-Modell ist auf Programmierung und längerfristige Aufgaben von AI-Agenten ausgelegt. Der Zugriff erfolgt über verwaltete APIs; Prompt-Caching und regionsübergreifende Inferenz werden unterstützt.

  2. AWS Machine Learning Blog42

    Anleitung: Claude Code mit Amazon Bedrock für regulierte Workloads nutzen

    Der AWS-Beitrag erklärt, wie sich Claude Code mit Amazon Bedrock in AWS GovCloud (US) für KI-gestützte Entwicklungsabläufe bei regulierten Workloads einrichten lässt. Er beschreibt Voraussetzungen, Konfiguration und Prüfung sowie die verfügbaren Claude-Modelle und Bedrock-Endpunkte. Organisationen müssen die Lösung an ihren eigenen Compliance-Anforderungen messen.

5. Okt.Mo
  1. GitHub Blog · AI & ML59

    ReviewBench: Ein offener Benchmark für KI-Code-Reviews

    GitHub stellt mit ReviewBench einen offenen Benchmark zur Bewertung von KI-Code-Review-Agenten bereit. Der Datensatz umfasst 219 Pull Requests aus 187 öffentlichen Repositories und 19 Sprachen; seine Verteilung orientiert sich an 103.9 Millionen GitHub-Pull-Requests. Senior Engineers stimmten bei der unabhängigen Prüfung der Befunde zu 96.6% mit ReviewBench überein.

  2. AWS Machine Learning Blog46

    Agentische Suche mit LangChain und Amazon Bedrock Knowledge Bases

    Der AWS-Beitrag zeigt, wie eine RAG-Anwendung mit LangChain in Amazon Bedrock Knowledge Bases zwischen einfacher und agentischer Suche wählen kann. Die agentische Suche zerlegt mehrteilige Fragen in Teilabfragen, prüft die Belege und sucht bei Bedarf erneut. Ein Vergleich der Suchwege zeigt auch ihre Kosten und wann die günstigere Variante genügt.

4. Okt.So
  1. Hugging Face Blog74

    Microsofts ThinkingBox prüft, was KI-Agenten tatsächlich ändern

    Microsoft hat ThinkingBox entwickelt und über Hugging Face verfügbar gemacht: Der Test prüft gespeicherte Angaben statt nur die Antworten von KI-Agenten. In einem Beispiel schloss ein Agent ein Ticket zur verspäteten Lieferung, obwohl der Lieferfall noch ungeklärt war und das Ticket auf «wartend» stehen sollte. Die 507 künstlich erstellten Aufgaben werden je 20-mal geprüft; ein einmaliger Erfolg zeigt noch nicht, dass der Agent zuverlässig handelt.

    Grund für die Empfehlung: Wer KI-Agenten Geschäftsvorgänge bearbeiten lässt, muss erkennen können, ob sie wiederholt die richtigen Angaben hinterlassen.

3. Okt.Sa
2. Okt.Fr
  1. AWS Machine Learning Blog64

    AWS zeigt, wie sich Mietverträge anhand festgelegter Regeln prüfen lassen

    AWS zeigt an einem Beispiel mit künstlich erstellten Mietverträgen, wie Amazon Quick Fragen entgegennimmt und festgelegte Regeln über die Ergebnisse entscheiden. Die KI wählt eine vorgegebene Prüfung und erklärt das Ergebnis; das System zählt auch unklare und unlesbare Verträge, damit erfasste Verträge nicht unbemerkt fehlen. Das Beispiel belegt keine Prüfung echter Verträge; zudem zeigt die Zählung nur, ob alle zuvor erfassten Verträge berücksichtigt wurden.

    Grund für die Empfehlung: Bei vielen Verträgen ist entscheidend, wer die Prüfung vornimmt und ob fehlende oder unlesbare Unterlagen sichtbar bleiben.

  2. Hugging Face Blog47

    Wie AutoSynthData Trainingsdaten für Unternehmensagenten erzeugt

    ServiceNow CoreAI hat AutoSynthData entwickelt, um Schwächen von Unternehmensagenten in neue Trainingsaufgaben umzuwandeln. Das System vergleicht Fehler des Zielmodells mit Erfolgen eines stärkeren Modells und prüft, ob die erzeugten Aufgaben realistisch, lösbar und verlässlich bewertbar sind. Mit den Fortschritten des Zielmodells verschiebt sich der Schwerpunkt auf verbleibende Schwächen.

  3. NVIDIA Blog68

    NVIDIA meldet bis zu achtmal schnellere Texterzeugung mit GPT-6 Astra Ultrafast

    Laut NVIDIA erzeugt GPT-6 Astra Ultrafast Text bis zu achtmal schneller als Astra Standard. Der Modus ist über die OpenAI-Schnittstelle für Entwickler sowie für berechtigte Nutzer von ChatGPT Work und Codex verfügbar. Die Anbieterangabe betrifft die Texterzeugung, nicht die Dauer ganzer Arbeitsabläufe oder die Qualität der Ergebnisse.

    Grund für die Empfehlung: Die Beschleunigung kann bei häufigen Modellantworten relevant sein, lässt sich aber nicht auf ganze Aufgaben übertragen.

1. Okt.Do
  1. NVIDIA Blog42

    Analyse: Wie NVIDIA AI Factories ihre Kapitalrendite steigern

    NVIDIA erklärt, wie hohe Leistung, lange Nutzungsdauer und vielseitige Einsatzmöglichkeiten die Rendite seiner AI Factories steigern sollen. Laut SemiAnalysis AgentX erreicht Vera Rubin NVL72 pro Megawatt mehr als den 30-fachen Durchsatz von GB300 NVL72; beim Modell DeepSeek V4 Pro sind die Kosten pro Million Token bis zu 45-mal niedriger. NVIDIA verweist zudem auf weiterhin genutzte ältere GPUs und auf Workloads ausserhalb der KI.

  2. Google DeepMind72

    Google DeepMind kündigt Gemini 4 Argon mit gestaffelter Freigabe an

    Google DeepMind kündigt Gemini 4 Argon an und stellt das Modell zunächst ausgewählten Cyberabwehr-Teams über das Fairwind Program bereit. Es ist für komplexe Aufgaben in Softwareentwicklung, Wissensarbeit und Cyberabwehr ausgelegt; das Ausgabelimit steigt von 64K auf 1M tokens. Vor einer breiteren Freigabe will Google Rückmeldungen aus Tests einarbeiten und Schutzmassnahmen weiterentwickeln.

    Grund für die Empfehlung: Der gestaffelte Zugang für Cyberabwehr und die angekündigten Schutzmassnahmen zeigen, wie Google DeepMind die Freigabe eines leistungsfähigen Modells vorbereitet.

30. Sept.Mi
  1. Google DeepMind70

    Google DeepMind stellt SynthID Bio zur Markierung KI-generierter Proteine vor

    Google DeepMind stellt SynthID Bio vor, ein Verfahren zur Markierung KI-generierter Proteinsequenzen und vorhergesagter 3D-Strukturen. Labortests mit Proteinbindern für drei Zielproteine zeigten laut Unternehmen vergleichbare Bindungswerte wie bei Entwürfen ohne Markierung. Methodenpapier, Code und In-vitro-Daten werden veröffentlicht; Modellgewichte stellt das Unternehmen der Forschungsgemeinschaft bereit.

    Grund für die Empfehlung: Die Markierung bleibt laut Labortests auch im hergestellten Protein nachweisbar. Das macht den Ansatz für die Prüfung synthetischer Entwürfe relevant.

29. Sept.Di
  1. Hugging Face Blog60

    NVIDIA veröffentlicht Kumo Tabular für Vorhersagen mit Tabellendaten

    NVIDIA veröffentlicht Kumo Tabular als offenes Basismodell für Klassifikation und Regression mit Tabellendaten auf Hugging Face. Es nutzt beschriftete Zeilen als Kontext und sagt Werte für neue Zeilen ohne zusätzliches Training oder Feature Engineering voraus. Das ausschliesslich mit künstlichen Tabellen vortrainierte Modell ist in drei Grössen von 28M bis 215M Parametern verfügbar und liegt laut NVIDIA auf vier Benchmarks vorn. Modellcode: https://github.com/NVIDIA/structured-data-models; Gewichte: https://huggingface.co/nvidia/Kumo-Tabular.

    Grund für die Empfehlung: Der Vergleich über vier Benchmarks ordnet die Modellleistung ein; die Angaben zu Trainingsdaten und Grenzen helfen bei der Einschätzung möglicher Einsätze.

  2. Microsoft Research63

    Microsoft Research stellt das KI-Forschungssystem Quine für die Biologie vor

    Microsoft Research stellt Quine vor, ein experimentelles Forschungssystem mit einem multimodalen Weltmodell der Biologie und einer Verbindung zu wissenschaftlichen Werkzeugen。

    Grund für die Empfehlung: Die Verbindung von Modellvorhersagen und Labortests zeigt am Beispiel von Bauchspeicheldrüsenkrebs, wie Quine die Auswahl von Wirkstoffen für weitere Versuche unterstützt.