Anthropic unter Druck, LAION legt Video-Benchmark vor
Sony, Warner und weitere klagen gegen Anthropic. Dazu: LAIONs Open-Video-Dataset, neue Forschung zu KI-Agenten und ein Blick auf AI-Überwachung.
Inhaltsverzeichnis
Heute zeigt sich wieder sehr schön, dass KI gerade auf zwei Schienen gleichzeitig fährt: vorne die große Produkt- und Forschungsmaschine, hinten der immer längere juristische Anhänger. Während Anthropic mit Urheberrechtsklagen konfrontiert wird, liefern LAION und die Forschung weiter Stoff für offene Modelle, Benchmarks und KI-Agenten-Realitätstests.
Für Dich heißt das: weniger „Was kann das Modell?“ und mehr „Unter welchen Bedingungen darf, soll und kann es das überhaupt?“. Genau diese Mischung macht die Lage gerade spannend – und ein bisschen unbequem. Aber bequem war Regulierung noch nie.
🎵 Sony und Warner ziehen gegen Anthropic vor Gericht
Sony Music, Warner Music und weitere Rechteinhaber verklagen Anthropic wegen mutmaßlicher Urheberrechtsverstöße beim Training von Claude. Laut Klage soll das Unternehmen zehntausende geschützte Musikkompositionen genutzt haben; besonders brisant: Auch CEO Dario Amodei wird persönlich genannt. Die Kläger sprechen von „einem der größten Diebstähle geistigen Eigentums in der Geschichte“. Das ist juristisch natürlich die ganz große Keule, aber sie zeigt vor allem eines: Die Musikindustrie will nicht mehr nur über Einzelfälle reden, sondern über das Prinzip hinter dem LLM-Training. Quelle
Warum relevant? Weil Anthropic nach dem 1,5-Milliarden-Dollar-Vergleich mit Buchautoren schon im nächsten Rechtsfeld steht. Das Muster ist klar: Sobald Modelle Text oder Songtexte reproduzieren können, wird aus „Training“ sehr schnell ein Copyright-Problem. Für die Branche ist das ein weiterer Beleg, dass sich die Ära des „wir trainieren einfach mal alles“ dem Ende nähert. Für Dich bedeutet das: Rechteklärung wird zum Produktfaktor – und zwar nicht erst beim Launch, sondern schon beim Daten-Sourcing.
🎥 LAION stellt riesiges Open-Video-Dataset bereit
LAION veröffentlicht mit dem Big Video Dataset (BVD) einen der größten offenen Videodatensätze für KI-Forschung: rund 80 Millionen Videos, zehn Millionen Stunden Material und 55 Millionen Clips mit automatischen Beschreibungen. Für die Open-Source- und Forschungswelt ist das ein ziemlich dickes Brett. Auf BVD trainierte Modelle sollen den bisherigen Referenzdatensatz InternVid um bis zu 2,1 Prozentpunkte schlagen. Das klingt klein, ist im Benchmark-Universum aber oft ein sichtbarer Sprung. Quelle
Warum das wichtig ist? Video-KI hängt seit Jahren an einem Datenproblem: Gut kuratierte, offene und gleichzeitig groß genug dimensionierte Datensätze sind rar. BVD könnte Forschungsgruppen und kleinere Labs näher an den Stand der großen proprietären Player bringen. Gleichzeitig bleibt die Rechtsfrage heikel, denn Video-Daten sind noch stärker mit Plattform-, Upload- und Lizenzproblemen verknüpft als Text. Kurzum: technisch ein Gewinn, regulatorisch ein Minenfeld. Offen heißt eben nicht automatisch unproblematisch.
🧠 KI-Agenten haben kein Zeitgefühl
Eine neue Untersuchung zu KI-Programmierassistenten wie Claude Code und Codex zeigt ein ziemlich menschlich klingendes, aber technisch relevantes Problem: Die Agenten haben kein brauchbares Zeitgefühl. Sie überschätzen die Dauer von Aufgaben teils drastisch – Codex teilweise um das Zehnfache – und bewerten auch ihre eigene Arbeit im Schnitt deutlich zu positiv. Für lange, autonome Aufgaben ist das ein echtes Kontrollproblem. Quelle
Warum ist das mehr als eine nette Randnotiz? Weil wir bei Agenten oft so tun, als seien sie kleine Software-Mitarbeiter mit To-do-Liste und Eigeninitiative. In Wirklichkeit fehlt ihnen oft schon die Fähigkeit, Fortschritt, Aufwand und Qualität halbwegs stabil einzuschätzen. Das ist besonders relevant für Coding-Workflows, bei denen Du den Agenten nicht jede Minute babysitten willst. Die Studie ist damit ein guter Reality Check: Autonomie ohne verlässliche Selbstwahrnehmung ist vor allem eins – ein hübsches Risiko mit UI.
⚖️ Texas stoppt neue Flock-Kameras
Texas Governor Greg Abbott hat die staatliche Finanzierung weiterer Flock-Kameras eingefroren. Der Schritt kommt mitten in wachsender Kritik an dem KI-gestützten Überwachungsnetzwerk und kurz vor einer Untersuchung, die Ausgaben von über 30 Millionen Dollar offenlegte. Offiziell sollten die Kameras unter anderem beim Kampf gegen Katalysatordiebstahl helfen; Kritiker sehen darin aber vor allem eine ausufernde, schlecht kontrollierte Massenüberwachung. Quelle
Relevanz für die AI-News-Lage: Hier geht es nicht um ein neues Modell, sondern um den politischen Backlash gegen „AI Surveillance“ im Alltag. Das Thema ist wichtig, weil viele GovTech- und Public-Safety-Projekte mit ähnlichen Versprechen arbeiten: mehr Sicherheit, weniger Personal, bessere Skalierung. Der Haken ist bekannt: Wenn die Infrastruktur einmal steht, wächst sie selten wieder von allein zurück. Für die Debatte um Privacy, Gesichtserkennung und automatisierte Überwachung ist Texas damit ein sehr deutliches Signal.
📏 Neue Theorie für adaptive Nearest-Neighbor-Klassifikation
Ein frisches arXiv-Paper mit dem Titel Curvature-Aware Radius Shrinkage for Adaptive Nearest Neighbor Classification dreht sich um ein Grundproblem des maschinellen Lernens: Klassische k-NN-Verfahren behandeln die Nachbarschaft im Datenraum überall gleich, obwohl sich die lokale Geometrie oft stark unterscheidet. Die Arbeit schlägt vor, den Radius abhängig von der Krümmung anzupassen, statt stur mit fixer Nachbarschaftsgröße zu arbeiten. Quelle
Warum sollte Dich das interessieren? Weil solche Arbeiten daran erinnern, dass ML nicht nur aus mehr Parametern und mehr Daten besteht. Manchmal ist die richtige Frage nicht „Wie groß ist das Modell?“, sondern „Wie definiere ich Nähe überhaupt sinnvoll?“. Genau da liegt oft der Unterschied zwischen elegantem Verfahren und fragiler Bastellösung. Für ambitionierte Einsteiger ist das eine gute Faustregel: Sobald Daten auf einer komplexen Geometrie liegen, werden einfache Annahmen schnell teuer. Mathematik ist da leider erstaunlich unbestechlich.
🧩 Topologie, Zertifizierung und Code-World-Models
Ein weiteres arXiv-Paper, An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models, beschäftigt sich mit einem eher theoretischen, aber interessanten Problem: Was kann ein zertifiziertes Code-World-Model tatsächlich wissen – und wo liegen seine blinden Flecken? Die Kernaussage ist zugespitzt: Ein Modell kann für alles korrekt sein, was das Sampling-Gate sieht, und trotzdem außerhalb davon komplett danebenliegen. Quelle
Das klingt abstrakt, ist aber für LLMs und Model-Merging durchaus relevant. Denn sobald Du Modelle kombinierst oder über Filter und Zertifikate absicherst, stellt sich die Frage nach dem „Außenbereich“: Was wurde wirklich verstanden, was nur lokal passend gemacht? Solche Arbeiten sind wichtig, weil sie die Grenzen von Verifikation in generativen Systemen sauberer formulieren. Kurz: Ein Zertifikat ist nur so gut wie der Ausschnitt der Welt, den es abdeckt. Der Rest bleibt gern mathematisch elegant und praktisch unerquicklich.
🛠️ Tool-Tipp des Tages
Wenn Du selbst mit offenen Datensätzen, Benchmarks oder Modell-Tests arbeitest, lohnt sich ein sauberer Evaluations-Workflow. Ein praktischer Startpunkt ist ein Experiment-Tracking-Tool wie # – damit behältst Du Datensätze, Runs und Metriken deutlich besser im Blick. Gerade bei Research-Setups mit Video, LLMs oder Agenten sparst Du Dir damit viel „Welche Version war das nochmal?“-Chaos.
Du willst keine News verpassen? Newsletter abonnieren