1010 | KI-Wochenrückblick: Agenten, Tools und Weltmodelle

||Download

Show notes

Diese Episode bündelt die wichtigsten neuen KI-Tools und -Modelle: vom Universal-Agenten mit eigener Identität über Agenten-Infrastruktur und Coding-Helfer bis zu Marketing-Automatisierung, Kreativ-Tools und einem Weltmodell, das Physik in Echtzeit simuliert.

Zeitleiste

  • 00:00:04 Einleitung
  • 00:00:53 Agenten mit eigener Identität
  • 00:03:02 Infrastruktur für Agenten
  • 00:05:53 Coding- und Desktop-Agenten
  • 00:08:07 Marketing- und Vertriebsautomatisierung
  • 00:10:51 Sprache, Meetings und Kommunikation
  • 00:12:52 Weltmodelle und kreative Tools
  • 00:15:20 Abschluss

Weitere Links

Diese Folge wurde von Bri produziert. Bri nutzt fortschrittliche KI-Technologie, um die Feeds, die dir wichtig sind, in Podcasts zum Zuhören zu verwandeln. Kontakt: hi@bri.so.

Transcript

Lena Vogel: Hallo und herzlich willkommen zur neuen Folge unseres Podiums – ich bin Lena Vogel.

Felix Hartmann: Und ich Felix Hartmann. Schön, dass du wieder dabei bist. Wir haben uns heute durch einen ganzen Stapel neuer Produkte und Ankündigungen gearbeitet, und eines fällt dabei sofort auf: Immer mehr dieser Tools handeln nicht für dich – sie handeln selbstständig. Agenten mit eigenem Account, eigene E-Mail, eigener Rechner, eigene Datenbank.

Lena Vogel: Genau dieses Bild zieht sich durch die ganze Folge. Wir schauen uns an, wie diese Agenten in den Arbeitsalltag rücken, was sie an Infrastruktur brauchen, wo sie im Code, im Vertrieb, in Meetings und sogar in Spielen auftauchen. Und wie immer gilt: Wir lesen hier nur die Produktbeschreibungen, also behandelst du alles, was Macher versprechen, als Behauptung – nicht als belegtes Ergebnis.

Felix Hartmann: Machen wir. Fangen wir mit dem Bild selbst an, denn es ist ziemlich prägnant: Ambiguous Workspace. Das ist ein Paket aus achtzehn KI-nativen Produktivitäts-Apps, und zwei Dinge stechen heraus. Erstens: kostenlos bis zu fünf Nutzern. Zweitens – und das ist der spannende Teil – die Agenten dort haben eine eigene Identität statt eines Logins.

Lena Vogel: Das ist ein kleiner, aber wichtiger Unterschied. Ein Login bedeutet normalerweise: Ein Agent arbeitet unter deinem Namen, mit deinen Rechten, und du siehst am Ende nicht genau, was er in deinem Namen getan hat. Eine eigene Identität heißt konzeptionell: Der Agent ist im System sichtbar als eigene Entität, mit eigenem Handlungsprofil. Das macht es zumindest einfacher nachzuvollziehen, was der Agent getan hat – und ihm Grenzen zu setzen.

Felix Hartmann: Und es passt zu einem zweiten Fall, der noch viel deutlicher in diese Richtung geht: Gemini Agent für Google Cloud. Die Beschreibung liest sich wie ein Stelleninserat für einen digitalen Kollegen. Ein Universal-Agent, der selbstständig plant, auf Workspace und M365 zugreift, MCP als Werkzeugschnittstelle nutzt – und der eine eigene E-Mail-Adresse bekommt.

Lena Vogel: Eigene E-Mail, das ist wirklich die Schwelle. Damit wird aus einem Tool, das du bedienst, ein Kollege, dem du Aufgaben gibst. Er kann Informationen anfordern, auf Nachrichten antworten, im Namen einer eigenen Adresse im Umlauf sein. Ob das im Alltag gut funktioniert, wissen wir aber nicht – wir haben hier nur die Produktbeschreibung.

Felix Hartmann: Und genau da sind wir ehrlich: Die offenen Fragen bei beiden sind Reife und Sicherheit. Was passiert, wenn so ein Agent eine E-Mail schreibt, die niemand geprüft hat? Wie fein sind die Rechte gesteuert? Eine eigene Identität ist ein guter Rahmen, aber sie ersetzt keine Kontrolle über das, was der Agent mit seinen Rechten anstellt.

Lena Vogel: Die Richtung stimmt jedenfalls: Agenten rücken in den Arbeitsalltag. Und wenn das passiert, entsteht sofort die nächste Frage – wohin mit dem ganzen Kram, den ein Agent braucht? Rechenleistung, Speicher, Zugriffsrechte. Und genau darum geht es bei den nächsten zwei Produkten, die wir uns ansehen.

Felix Hartmann: Das erste ist Pine Computer. Die Idee: ein Cloud-Computer, der speziell für KI gebaut ist. Der Unterschied zu einem normalen virtuellen Rechner ist konzeptionell interessant: Pine liest nicht Pixel, sondern App-Strukturen. Der Agent sieht also nicht einen Screenshot, sondern versteht, wie die Anwendung aufgebaut ist – wo Buttons sind, was Felder bedeuten.

Lena Vogel: Das versprechen die Macher jedenfalls. Die behaupteten Zahlen: zwei- bis fünffache Geschwindigkeit gegenüber dem Pixel-Ansatz und ein Fünfundzwanzigstel der Kosten. Diese Zahlen stammen aus der eigenen Beschreibung, das müssen wir klar sagen. Wenn sie auch nur annähernd stimmen, wäre das relevant, denn Screen-Reading ist der teure und fehleranfällige Teil der Agenten-Automatisierung.

Felix Hartmann: Verfügbar ist das Ganze bisher über eine Einladungs-Beta. Also: Wir wissen nicht, wie es sich unter echten Arbeitslasten verhält, und wir wissen auch nichts über spätere Preise. Das ist der Punkt, an dem ich immer vorsichtig werde – Beta-Zugang heißt, wir urbeln hier über eine Ankündigung, nicht über ein Produkt.

Lena Vogel: Und die zweite Infrastruktur-Frage: Speicher. Dort kommt Busabase ins Bild – eine Open-Source-Datenbank und ein Workspace, die ausdrücklich für KI-Agenten gedacht sind. Kern ist ein geteilter Datenspeicher, in dem mehrere Agenten arbeiten können, aber mit Zugriffs- und Änderungsprüfung.

Felix Hartmann: Das ist wichtig, weil genau dort die Lücke liegt. Wenn drei Agenten auf denselben Datensatz zugreifen, willst du nachvollziehen können, wer was geändert hat und ob der Agent das überhaupt durfte. Busabase adressiert das strukturell, und weil es Open Source ist, kann man sich den Code ansehen statt auf das Wort der Macher angewiesen zu sein.

Lena Vogel: Offene Frage dort: Skalierung und Preis. Ein Open-Source-Ansatz kostet erst mal nichts an Lizenz, aber Betrieb, Wartung, Skalierung – das sind echte Fragen, auf die die Beschreibung keine Antwort gibt.

Felix Hartmann: Es gibt übrigens zwei Produkte aus unserem Stapel, die gut zeigen, wie die Schnittstelle zwischen Agent und Mensch aussehen kann. Melete ist ein persönlicher KI-Agent, der einen eigenen Computer bekommt – also wieder dieses Bild – und ein dauerhaftes Gedächtnis. Das Modell soll wechselbar sein, die Cloud-Warteliste ist offen. Also: dauerhaftes Gedächtnis klingt gut für Kontinuität, wirft aber natürlich die Frage auf, wo diese Erinnerungen liegen und wer darauf Zugriff hat.

Lena Vogel: Und OpenCharm geht in die entgegengesetzte Richtung – zur sichtbaren Schnittstelle. Ein Open-Source-Begleiter mit Gesicht und Stimme, der am Mac-Notch sitzt und den Status der Agenten zeigt, steuerbar per Taste. Also quasi die menschliche Seite desselben Themas: Wenn Agenten selbstständig arbeiten, willst du irgendwo sehen, was sie gerade tun, und sie kurz unterbrechen können.

Felix Hartmann: Genau. Infrastruktur unten, Schnittstelle oben – und dann das eigentliche Arbeitsfeld in der Mitte. Schauen wir, wo Agenten heute am konkretesten arbeiten: im Code und auf dem Desktop.

Lena Vogel: OpenPilot ist da ein Beispiel. Ein Desktop-KI-Agent, MIT-lizenziert, also wirklich frei nutzbar. Er kann Dateien lesen und editieren, und du kannst eigene Modelle über die OpenAI-API anbinden. Das heißt: Du bist nicht an ein bestimmtes Modell des Herstellers gebunden, sondern bringst dein eigenes mit.

Felix Hartmann: Vorgemerkt ist macOS als kommende Plattform, „bald". Auch hier also wieder der Vorbehalt: attraktives Konzept, aber der Beweis, wie gut er tatsächlich in täglicher Arbeit funktioniert, steht noch aus. Kostenlos und offen ist trotzdem ein sinnvoller Einstiegspunkt für Leute, die so etwas ausprobieren wollen.

Lena Vogel: Für Entwickler gibt's dann mit Together Link noch eine Ökonomie-Ebene. Together Link verbindet Coding-Agenten – konkret Claude Code und Codex sind genannt – mit offenen Modellen auf Together AI. Der Nutzen laut Beschreibung: sinkende Kosten, weil man die teuren Premium-Modelle nicht für jede Aufgabe braucht. Das Angebot selbst ist kostenlos.

Felix Hartmann: Das ist praktisch dieselbe Logik wie bei OpenPilot: Modellwahl entkoppeln vom Agenten. Wenn die Qualität der offenen Modelle für die jeweilige Aufgabe reicht, drückt das die laufenden Kosten deutlich. Aber ob die Ergebnisse gleichwertig sind, hängt stark von der Aufgabe ab – das ist ein klassischer Fall von „versprechen ist einfacher als beweisen".

Lena Vogel: Und dann zwei Werkzeuge, die zeigen, wie breit das Agenten-Thema wird. Opposable lässt Claude Code und Codex auf echten iPhones und Android-Handys tippen. Also nicht auf einem Emulator, sondern auf realer Hardware. Wichtig: Zahlungen warten auf Nutzerfreigabe – da ist also bewusst ein Mensch im Loop, bevor Geld bewegt wird.

Felix Hartmann: Das ist ein nettes Detail, weil es genau die Frage beantwortet, die wir vorhin zu Agent-Identitäten gestellt haben: Wie begrenzt man riskante Aktionen? Antwort hier: Freigabe durch den Nutzer bei Zahlungen. Und dann noch Refs – eine Bibliothek aus über dreitausend Filmen, aufbereitet als Schnitt-Blueprints und Prompts, abrufbar über MCP für Claude Code, Codex und Cursor. Also Wissen aus der Filmschnitt-Praxis als direkt nutzbarer Input für Coding-Agenten.

Felix Hartmann: Ob die Qualität der Blueprints wirklich hilft, bleibt offen – aber die Idee, Domänenwissen maschinenlesbar zu machen, ist charmant.

Lena Vogel: Apropos maschinenlesbar und breit einsetzbar: Kommen wir zum Bereich, wo Agenten offenbar richtig Geld sparen sollen – Marketing und Vertrieb. Dort ist AgentDR vermutlich das konsequenteste Beispiel aus unserem Stapel.

Felix Hartmann: AgentDR ist eine Open-Source-KI-SDR – also ein Vertriebs-Außendienstler aus Software. Die Behauptung der Macher: Er ersetzt Clay, Smartlead und HubSpot. Er kann E-Mail, LinkedIn und WhatsApp, er ist selbst gehostet, und du bringst deine eigenen KI-Keys mit.

Lena Vogel: Das „ersetzt"-Versprechen müssen wir als Anspruch der Macher lesen, nicht als geprüfte Fakten. Aber das Paket ist bemerkenswert: selbst gehostet heißt, die Kundendaten liegen bei dir, nicht bei einem SaaS-Anbieter. Eigene KI-Keys heißt, du zahlst das Modell direkt und siehst, was fließt. Open Source heißt, du kannst prüfen, was der Agent mit deinen Leads macht. Das sind drei der üblichen Sorgen beim Thema „KI schreibt meinen Kunden" auf einmal adressiert.

Felix Hartmann: Die offenen Fragen bleiben trotzdem: Wie gut ist die Qualifizierung der Leads wirklich? Wie vermeidet man, dass die Nachrichten wie Massenware klingen? Das steht nirgends belegt. Aber die Richtung ist klar: Vertriebsautomatisierung wandert vom teuren SaaS-Stack zu einem selbstkontrollierten Agenten.

Lena Vogel: Auf derselben Ebene – Werkzeuge für Agenten im Marketing – liegt Zernio. Das ist Marketing-Infrastruktur: eine einzige API für sechzehn Social-Plattformen, dazu Ads, WhatsApp, iMessage und Telefonie. Und für Agenten gibt's einen MCP-Zugang.

Felix Hartmann: Das ist im Grunde das Klempnerstück. Agenten im Marketing scheitern oft nicht an der Intelligenz, sondern daran, dass jedes Netzwerk seine eigene API hat. Eine Sammelschnittstelle mit MCP-Anbindung ist die Antwort darauf. Und BrightBean Studio passt in dieselbe Lücke: eine Open-Source-Alternative zu Buffer, AGPL-lizenziert, mit Scheduling für über zehn Plattformen, MCP-Server inklusive, und ohne Sitzplatzpreise.

Lena Vogel: „Ohne Sitzplatzpreise" ist der Knackpunkt – klassische Social-Media-Tools rechnen pro Nutzer ab, wasTeams teuer macht. BrightBean wirft diese Preisstruktur über Bord. Und auch hier: Open Source heißt prüfbar. Drei Produkte, drei Ebenen desselben Themas – AgentDR ersetzt den Vertriebsstack, Zernio liefert die Kanal-Infrastruktur, BrightBean macht das Scheduling frei.

Felix Hartmann: Und weil wir gerade bei Kanälen sind: Da gehört auch Kommunikation dazu. Comcent ist da eine Randnotiz, die aber ins Bild passt: eine Sprach-Infrastruktur auf dem eigenen SIP-Trunk mit KI-Transkription und Zusammenfassung, vCon-Ausgabe, unbegrenzte Nutzer für zwanzig Dollar im Monat, ebenfalls AGPL. Also wieder das Muster: Sprache erfassen, auswerten, selbst hosten. Das leitet gut über zu unserem nächsten Thema – Sprache als Arbeitsmedium.

Lena Vogel: Genau, denn der lauteste Fall ist vielleicht HeyPi. Das ist eine KI-Meeting-Plattform, die Gespräche live verfolgt und Ideen während des Meetings in Apps, Decks und Websites umsetzt. Also nicht: Nachbesprechung, Protokoll, drei Tage später ein Entwurf. Sondern während du noch redest, entsteht das Ergebnis.

Felix Hartmann: Das ist ambitioniert. Wenn das wirklich in Echtzeit funktioniert, verändert das die Meeting-Kultur: Man würde nicht mehr „über" Ergebnisse reden, sondern nebenbei Ergebnisse erzeugen. Aber Echtzeit-Qualität ist genau der Punkt, den Beschreibungen gut behaupten und Alltag schwer hält. Wie gut die Ergebnisse sind, ob man sie nachjustieren kann – offen.

Lena Vogel: Eine Spur bescheidener, aber vielleicht alltagstauglicher: Murmur. Das ist eine private Voice-First-Notiz-App. Du sprichst, und die Sprache wird zu durchsuchbarer Erinnerung – mit semantischer Suche und automatischer Aufgaben-Extraktion.

Felix Hartmann: Semantische Suche ist hier der entscheidende Unterschied zu klassischen Sprachnotizen. Bei einem herkömmlichen Tool suchst du nach Stichworten, die du damals zufällig gesagt hast. Mit semantischer Suche fragst du „was hatte ich zu dem Kundenprojekt gesagt" und findest es, auch wenn das Wort „Kundenprojekt" nie gefallen ist. Die Aufgaben-Extraktion macht daraus dann direkt To-dos.

Lena Vogel: Und die dritte Ebene desselben Themas: der Telefonanruf. Phonable ersetzt die iPhone-Voicemail. Anrufer bekommen die Option, stattdessen eine SMS zu schreiben, und der Nutzer bekommt ein Transkript plus KI-Zusammenfassung des Anrufs.

Felix Hartmann: Das ist eine pragmatische Lösung für ein echtes Alltagsproblem – Voicemail ist für viele einfach ein schwarzes Loch. Statt einer Sprachnachricht, die man nie abhört, ein Text, den man scannen kann. Die offenen Fragen im ganzen Sprach-Block sind dieselben wie immer bei Sprache: Datenschutz und Genauigkeit. Wenn jede Konversation transkribiert, zusammengefasst und gespeichert wird, will man wissen, wo das landet.

Felix Hartmann: Und Zusammenfassungen von Meetings oder Anrufen sind nur so gut wie die Transkription dahinter.

Lena Vogel: Kommen wir zum letzten Block – und der ist bewusst eine Mischung aus sehr ernst und sehr verspielt. Das ernste Ende ist Odyssey 3, ein Foundation-Weltmodell von Foundation. Weltmodell heißt: Das System lernt, wie die physische Welt funktioniert, und kann sie simulieren.

Felix Hartmann: Die behaupteten Fakten: Echtzeit-Physiksimulation, Bestwert 66,1 auf dem Physics-IQ-Benchmark, und Anwendungsfälle in der Steuerung von Robotern und Autos. Das Benchmark-Ergebnis ist zumindest ein konkreter, nachprüfbarer Anspruch – besser als reines Marketing. Wenn Weltmodelle wirklich Echtzeit-Physik in dieser Qualität können, ist das ein Baustein für Robotik und autonomes Fahren, wo man Bewegungen vorher simulieren muss, bevor man sie ausführt.

Lena Vogel: Und das verspielte Ende: Playground von Google Labs. Eine KI-Spielplattform, auf der man Spiele allein durch Textbeschreibung erstellt – ohne Code –, sie teilt und dann per Chat weiter anpasst.

Felix Hartmann: Das ist im Grunde dasselbe Prinzip wie die Agenten vorhin, nur im Unterhaltungsbereich: Du beschreibst ein Ziel, das System baut es, du iterierst im Dialog. Und die Chat-Anpassung ist wichtig – das erste Ergebnis wird selten gut sein, der Wert entsteht im Nachschärfen.

Lena Vogel: Und um das Bild abzurunden, noch vier Tools, die jeweils eine sehr konkrete Nische füllen. OpenVids ist eine Open-Source, agentische Video-Bearbeitung für Mac und Windows – du gibst Anweisungen im Chat, es wird auf der Timeline editiert, mit Render-QA und Checkpoints. Also Video-Schnitt, wie man ihn mit einem Agenten führen würde.

Felix Hartmann: Rune ist ein Mac-Texteditor mit einer einzigen Idee: ein Scratch-File, das über iCloud geteilt wird, mit konfliktfreiem Mergen zwischen Macs. Einmalig neunzehn Dollar. Klein, aber für Leute, die zwischen mehreren Macs arbeiten, löst das ein echtes Ärgernis.

Lena Vogel: Thravik ist ein Mac-Browser, der bewusst nicht auf Chromium basiert, mit einer Funktion namens Private Memory: gelesene Seiten werden geräteintern verschlüsselt gespeichert, suchbar per Cmd-K. Also Browser-Verlauf, aber privat, lokal, verschlüsselt und sinnvoll durchsuchbar.

Felix Hartmann: Und Regunow rundet den Stapel ab: KI-Regulationsrecherche. Man beschreibt die Recherche in Klartext, bekommt KI-Antworten mit autoritativen Quellen, dazu Dokumentvergleich, Gap-Analyse und strukturierte Berichte. Der Mehrwert gegenüber einer einfachen KI-Suche sind die Quellen und die strukturierte Aufbereitung – für Compliance-Themen ist „nur die KI sagt es" kein brauchbarer Standard.

Lena Vogel: Und damit sind wir am Ende. Wenn man den ganzen Stapel auf eine Zeile reduzieren will: Agenten werden von Werkzeugen zu Beteiligten. Sie bekommen Identität, Rechner, Speicher, Kanäle – und immer öfter auch Grenzen wie Nutzerfreigabe bei Zahlungen.

Felix Hartmann: Und was bleibt unbeantwortet? Fast alles, was Alltagstauglichkeit betrifft. Das ist bei Ankündigungstagen normal, aber die spannenden Fragen entstehen ja gerade jetzt: Wer haftet für das, was ein Agent mit eigener E-Mail verschickt? Wie skalieren selbst gehostete Stacks? Und stimmen die versprochenen Zahlen, wenn echte Nutzer sie testen?

Lena Vogel: Wir bleiben dran und schauen uns diese Tools an, sobald es mehr als Beschreibungen zu sehen gibt. Danke, dass du dabei warst – bis zur nächsten Folge.

Felix Hartmann: Bis dann, tschüss!