AI Blog
· daily-digest · 5 Min. Lesezeit

Google, Benchmarks und Anthropic unter Druck

Google testet KI-Benchmarks doppelblind, LAION öffnet ein riesiges Videodataset und Anthropic gerät juristisch weiter unter Druck.

Inhaltsverzeichnis

Heute geht es um drei große Themen, die den KI-Markt gerade ordentlich durchschütteln: Vertrauen in Benchmarks, offene Daten als Rohstoff für Forschung und der juristische Gegenwind für Anthropic. Dazu kommen zwei Google-Updates, die zeigen, dass der Konzern bei KI-Forschung und Sicherheit nicht nur mitlaufen, sondern Standards setzen will.

Wenn Du wissen willst, wohin sich KI-Entwicklung gerade bewegt, dann ist diese Mischung aus Evaluierung, Datenpolitik und Regulierung ziemlich aufschlussreich. Kurz gesagt: Weniger Show, mehr System.

🔒 Google testet doppelblinde KI-Benchmarks

Google DeepMind testet erstmals eine doppelblinde Evaluierung eines Frontier-Modells – und das ist wichtiger, als es auf den ersten Blick klingt. Über Confidential Space soll verhindert werden, dass Google die Testfragen sieht oder die Prüfer Zugriff auf die Modellgewichte bekommen. Damit adressiert der Konzern ein echtes Problem: Viele KI-Benchmarks sind nur so vertrauenswürdig wie ihr Setup. Und das ist leider oft ungefähr so robust wie ein IKEA-Regal nach dem dritten Umzug.

Im Pilotprojekt mit dem Singapore AI Safety Institute kommt ein Gemini Flash Lite zum Einsatz. Der Ansatz könnte helfen, Manipulationen, Leak-Risiken und “optimierte” Testbedingungen einzudämmen. Für die Branche wäre das ein möglicher neuer Goldstandard für KI-Evaluation und Confidential Computing – gerade in einer Zeit, in der Benchmarks immer öfter Marketing statt Messinstrument sind.

Quelle: The Decoder

🎥 LAION öffnet das Big Video Dataset für Forschung

LAION stellt mit dem Big Video Dataset (BVD) einen der größten offenen Videodatensätze für KI-Forschung bereit. Die Dimensionen sind beeindruckend: 80 Millionen Videos, rund zehn Millionen Stunden Laufzeit und 55 Millionen Clips mit automatischen Beschreibungen. Für Video-KI ist das ein echter Rohstoff-Boost, denn gute Modelle brauchen nicht nur Rechenleistung, sondern vor allem große, vielfältige und brauchbare Daten.

Spannend ist auch der Benchmark-Effekt: Modelle, die auf BVD trainiert wurden, sollen den bisherigen Referenzdatensatz InternVid um bis zu 2,1 Prozentpunkte übertreffen. Das klingt klein, ist in der Forschung aber oft ein ziemlich deutlicher Schritt. Rechtlich beruft sich LAION offenbar auf ein Hamburger Urteil zur Datenverarbeitung – ein Hinweis darauf, dass Open-Source, Dataset-Forschung und Copyright weiter eng zusammenhängen. Für alle, die an Video-Modellen arbeiten, ist das: sehr relevant, sehr groß, sehr datenhungrig.

Quelle: The Decoder

🧪 DeepMinds Co-Scientist wird zum Forschungspartner

Google DeepMind hat Co-Scientist vom Hypothesengenerator zum laborintegrierten Forschungssystem ausgebaut. Das Gemini-basierte Multi-Agenten-System ist laut Bericht nicht mehr nur ein Vorschlagsautomat für clevere Ideen, sondern liefert in drei Disziplinen experimentell validierte Ergebnisse. Von Materialsynthese bis zur autonomen Entwicklung einer medizinischen KI-Architektur ist hier nicht mehr nur “spannende Demo”, sondern echte Forschungsunterstützung im Spiel.

Warum das relevant ist: Wenn KI nicht nur Texte zusammenfasst, sondern den Forschungsprozess selbst mitgestaltet, verändert das die Arbeitsweise in Laboren massiv. Dann geht es nicht mehr nur um Prompting, sondern um Arbeitsabläufe, Validierung und wissenschaftliche Verantwortung. Das ist der Punkt, an dem man als Mensch noch wichtig bleibt – zumindest bis das System den ersten Kaffee auch noch mitdenkt.

Quelle: The Decoder

⚖️ Gericht erklärt Pentagon-Einstufung von Anthropic für rechtswidrig

Ein Bundesgericht in San Francisco hat die Einstufung von Anthropic als Lieferkettenrisiko durch das Pentagon für rechtswidrig erklärt. Der Vorwurf: Das Verteidigungsministerium habe das Unternehmen aus Vergeltung für öffentliche Kritik an der KI-Politik der Regierung auf eine Art schwarze Liste gesetzt. Formal bleibt die Einstufung zwar bestehen, weil ein Parallelverfahren in Washington noch läuft – aber das Signal ist klar.

Für Anthropic ist das wichtig, weil die Bewertung auch mit dem geplanten Börsengang und dem politischen Umfeld zusammenhängt. Für die gesamte KI-Branche ist der Fall ein Reminder, dass Regulierung, öffentliche Kritik und unternehmerische Interessen inzwischen eng verflochten sind. Wer im KI-Sektor groß werden will, muss also nicht nur Modelle bauen, sondern auch juristisch schwimmen können. Und zwar gegen Strömungen aus mehreren Richtungen.

Quelle: The Decoder

Sony Music und Warner Chappell haben in den USA Klage gegen Anthropic eingereicht – wegen angeblich zehntausender urheberrechtlich geschützter Werke. Die Kläger fordern bis zu 150.000 Dollar pro Werk sowie zusätzliche Strafen, falls identifizierbare Copyright-Daten entfernt wurden. Im schlimmsten Fall reden wir über Schäden in Milliardenhöhe. Das ist juristisch natürlich noch nicht entschieden, aber die Größenordnung zeigt schon: Der Urheberrechtskonflikt rund um generative KI ist längst kein Randthema mehr.

Für Dich als Beobachter der Branche heißt das: Der Rechtsrahmen für KI-Training bleibt einer der größten Unsicherheitsfaktoren. Besonders heikel ist, dass hier nicht nur die Frage “Darf man das?” im Raum steht, sondern auch “Was kostet es, wenn nicht?”. Für Anbieter von generativer KI ist das ein klarer Hinweis, dass Datenherkunft, Lizenzierung und Compliance keine Nebensache mehr sind.

Quelle: The Verge

🛠️ Tool-Tipp des Tages

Wenn Du mit Video- oder Forschungsdaten arbeitest, lohnt sich ein sauberer Workflow für Datasets, Versionierung und Experimente. Gerade bei offenen Datensätzen wie BVD oder bei Multi-Agenten-Setups ist Reproduzierbarkeit Gold wert. Für solche Workflows ist ein Tool zur Modell- und Experimentverwaltung schnell hilfreich – schau Dir zum Beispiel # an.

🧠 Forschung ohne Zentrum: Verteiltes Lernen im Hintergrund

Ein neuer arXiv-Preprint zu “Decentralized Multitask Learning over Learned Task Graphs” zeigt, wohin sich ein Teil der ML-Forschung bewegt: weg von zentralen Annahmen, hin zu verteilten Daten und dynamisch gelernten Beziehungsstrukturen. Die Arbeit untersucht, wie multitask learning funktioniert, wenn die Aufgabenbeziehungen nicht bekannt sind und erst aus den verteilten Daten gelernt werden müssen.

Das ist vor allem für reale Anwendungen spannend, in denen Daten auf verschiedene Standorte, Geräte oder Organisationen verteilt sind. Genau dort scheitern viele elegante Modelle aus dem Labor an der Praxis. Der Ansatz könnte also für dezentralisiertes Lernen, Edge-Umgebungen und vernetzte Systeme relevant werden. Unterm Strich zeigt das Paper: KI-Forschung wird nicht nur größer, sondern auch systemnäher. Und das ist meistens der Punkt, an dem es interessant wird.

Quelle: arXiv


Du willst keine News verpassen? Newsletter abonnieren


Wöchentlich die wichtigsten KI-News

Kein Spam. Keine Werbung. Nur das Wesentliche — kompakt zusammengefasst. Wöchentlich in deinem Postfach.