
1009 | Agentes, modelos y apps: la semana en IA
Show notes
Hoy recorremos lo más nuevo en IA: agentes de código que trabajan por ti, la guerra de modelos y cómo se evalúan, apps de escritorio que cambian tu día a día, y una ronda de infraestructura y gadgets curiosos. Todo con datos verificados y qué esperar de cada uno.
Línea de tiempo
- 00:00:04 Apertura
- 00:00:42 Agentes de código: del terminal a la nube
- 00:03:59 Modelos, precios y pruebas: cómo se elige la IA
- 00:07:06 Escritorio y vida diaria: mascotas, voz y películas
- 00:09:24 Servidores caseros, túneles y gadgets con motores
- 00:11:53 Cierre
Enlaces relacionados
- NOVA CLI v1.0
- pmtui
- OpenSwarm
- Claude for Google Workspace
- Polylane for Vercel
- Claude Haiku 5.5
- Liquid Inference
- Cekura Bench
- Griffin by Tavus
- ChickyTutor
- Hark
- judged.systems
- Side
- Paw-Paw
- Tonefold
- Markdoc
- Off the Record
- Tractionwave
- Drunken Penguins
- Udon
- tunnl.gg
- tide
- Moonwalkers Dusk
- aegis
Este episodio es producido por Bri. Bri usa tecnología avanzada de IA para convertir los feeds que te importan en podcasts pensados para escuchar. Puedes escribirnos a hi@bri.so.
Transcript
Clara Vega: ¡Hola! Bienvenidos de nuevo, soy Clara Vega.
Mateo Ruiz: Y yo, Mateo Ruiz. Gracias por acompañarnos en esta edición del briefing. Y sí, hablando de briefing, hoy traemos una mirada tipo Product Hunt de las últimas veinticuatro horas: elegimos un puñado de lanzamientos y les dedicamos tiempo de verdad, no una lista de sesenta segundos.
Clara Vega: Exacto. La idea es que salgas de aquí entendiendo qué problema resuelve cada cosa, qué la diferencia, qué promete el creador —que siempre lo tratamos como promesa, no como resultado verificado— y qué queda por responder. Y el hilo que conecta casi todo hoy es la IA: del terminal a la nube, de los modelos al escritorio, hasta el zapato con motor. Empezamos con los agentes de código.
Mateo Ruiz: Vamos con ello. El primero es Nova CLI, un desarrollador de IA que vive en el terminal. La promesa del equipo es simple: lee tu proyecto, edita el código, corre los tests y el build. Lo interesante del modelo de negocio es que incluye más de ciento sesenta modelos dentro de los planes pagos, así que no tienes que gestionar claves de API por ningún lado.
Clara Vega: Y eso último importa más de lo que parece. Tradicionalmente, si querías un agente en el terminal, montabas la herramienta, ponías tu clave de OpenAI o de Anthropic, controlabas el gasto... Nova dice: olvídate, te lo damos empaquetado. ¿Para quién es? Para desarrolladores que ya viven en el terminal y quieren menos fricción. ¿La limitación? Todo lo que se dice es la descripción del creador: no sabemos qué tan bien edita realmente, ni cómo se comporta en proyectos grandes.
Clara Vega: Habría que probarlo con tu propio código.
Mateo Ruiz: Ahora, si lo tuyo es más bien supervisar agentes que ya están corriendo, hay otra pieza: pmtui. Es un supervisor escrito en Rust sobre tmux para sesiones de Claude o Codex de larga duración. Y la parte que me llamó la atención es el autopiloto: resuelve las decisiones rutinarias por su cuenta y solo escala al humano lo que de verdad lo necesita.
Clara Vega: Eso conecta directo con la pregunta que dejamos en el aire de este bloque: ¿cuánto control humano se va a mantener cuando estos agentes escalen? Porque fíjate en el patrón. Nova dice "te hago el trabajo completo". pmtui dice "hay muchos agentes, demasiados para revisar todo a mano, así que el software decide qué llega a tu escritorio". Es una rendición parcial, pero razonada: tú defines qué es rutinario.
Mateo Ruiz: Y luego está el salto de escala. OpenSwarm lanza un escritorio de IA para Mac donde enjambres de agentes trabajan en paralelo con contexto compartido, con navegador y apps a mano. Gratuito, de momento con lista de espera. Ya no es un agente ni una sesión supervisada: son muchos a la vez, colaborando.
Clara Vega: Y ahí la pregunta de control se vuelve serio. Si un agente edita código y tú lo revisas, bien. Si diez agentes comparten contexto y actúan en paralelo sobre tu máquina, ¿qué revisas tú? Lo honesto es decir: OpenSwarm es gratuito con lista de espera, o sea que casi nadie lo ha tocado aún. Es una promesa de producto, no un resultado. Dicho eso, la dirección es clara: terminal, supervisor, enjambre. Tres grados de autonomía creciente.
Mateo Ruiz: Y la nube se mete en dos lugares donde antes no estaba. Primero, Claude para Google Workspace: funciona dentro de Docs, Sheets y Slides, en beta para planes pagos, edita archivos y además permite crear y editar archivos desde el propio Claude. Es decir, la IA deja de ser una pestaña aparte y se sienta dentro de tus documentos.
Clara Vega: Segundo, Polylane para Vercel, disponible en el Vercel Marketplace: un ingeniero de plantón por IA. Cuando aparece una regresión, investiga con evidencias y abre un pull request con la corrección para revisión humana. Nota la palabra clave: "para revisión". No mezcla a producción directamente; el PR pasa por ti.
Mateo Ruiz: Y ahí tenemos todo el espectro del bloque: Nova y OpenSwarm delegan mucho; pmtui y Polylane construyen el punto de control humano dentro del flujo; Claude en Workspace simplemente se integra donde ya trabajas. Mi lectura: el control no desaparece, se mueve. Deja de ser "aprobar cada línea" y pasa a ser "aprobar decisiones y resultados". Lo que nadie ha respondido todavía es si esa revisión de segundo nivel escala cuando los enjambres sean la norma.
Clara Vega: Buen puente, porque ahora pasamos justo a la capa de debajo: los modelos y cómo se eligen y se pagan. Anthropic lanzó Claude Haiku 5.5, su modelo pequeño. Los datos que tenemos: más rápido, alrededor de un setenta y cinco por ciento más barato, y es el primer Haiku con ajuste de esfuerzo, pensado para alto volumen.
Mateo Ruiz: El ajuste de esfuerzo es la novedad conceptual: le dices cuánto pensar debe invertir el modelo en cada tarea. Para tareas triviales no gastas cognición de sobra; para las difíciles, sí. Es un modelo para cargas masivas, no para razonar sobre la física del universo.
Clara Vega: Y aquí viene el giro de mercado. Liquid Inference propone un router de LLM donde los proveedores compiten por precio en cada prompt. La API es compatible con OpenAI y Anthropic, así que teoricamente cambias el endpoint y ya. Y regalan veinte dólares a los primeros quinientos.
Mateo Ruiz: Es casi una subasta inversa por token. Si Haiku baja precios y compite por cada prompt, el comprador deja de casarse con un proveedor. Ahora, las preguntas abiertas son las de siempre en routers: ¿la calidad se mantiene constante cuando el precio cambia de proveedor? ¿Qué pasa con la latencia? Son cosas que el lanzamiento no responde.
Clara Vega: Y luego está la parte de verificar lo que compras. Cekura Bench hizo un benchmark de habla a habla con nueve modelos en llamadas telefónicas reales, con ochenta y dos escenarios. El mejor modelo individual fue GPT Realtime 2.1, con un setenta y nueve coma tres por ciento. Pero aquí viene el titular: una cascada —o sea, una cadena de varios modelos— superó a todos con ochenta y dos coma nueve por ciento.
Mateo Ruiz: Eso es contraintuitivo y valioso. Uno pensaría que el modelo más grande y caro gana siempre, pero encadenar modelos, cada uno donde es fuerte, superó al mejor individual. Ojo, es un benchmark de una empresa concreta con sus escenarios: es evidencia, no una ley universal. Pero pone datos a la discusión de "cómo se elige".
Clara Vega: Y rematamos el bloque con la frontera de la verificación. Griffin, de Tavus, es el primer modelo de interacción humana dúplex vídeo-a-vídeo. Y el dato que dan: el cuarenta y ocho por ciento de los participantes pensó que era una persona real. Está en preview para testadores.
Mateo Ruiz: O sea: la mitad de la gente no distinguió. Trátalo como un claim de la empresa, con toda la industria por detrás, pero la señal es clara: la prueba del algodón de "¿es humano?" ya no funciona. Conecta con todo lo anterior: si no puedes distinguir al modelo, necesitas benchmarks como Cekura y necesitas routers como Liquid que te den control sobre qué modelo atiende cada cosa.
Clara Vega: Y cuando el modelo es tan bueno que parece persona, aparece el uso doméstico. ChikyTutor es un tutor de idiomas por voz con lousa interactiva en más de setenta idiomas; tiene una alianza con L'école de français para francés híbrido y acaba de lanzar en Android. Es un buen ejemplo de modelo de voz aplicado a algo concreto y medible: ¿aprendes o no?
Mateo Ruiz: Y si vamos a lo personal-proactivo, Hark Pro: una IA que actúa por su cuenta en correo, calendario, compras y viajes, con su propio computador en la nube, credenciales cifradas y la acción visible para ti. Es Griffin en tu agenda, digamos. Y para soporte, Judged.systems ofrece una API de juicio: el ticket se convierte en una decisión con probabilidades, y los limiares deciden si se acepta o se revisa. Todo lo mismo: delegación con puntos de control explícitos.
Clara Vega: Vamos a bajar de los modelos a tu escritorio, literalmente. Side es un panel de IA al lado del Dock en macOS, con multi-proveedor en un solo chat, atajo con comando, shift y espacio, gratuito y open source bajo licencia MIT.
Mateo Ruiz: Para quien ya tiene sus claves y quiere el chat siempre a un gesto de distancia, sin cambiar de ventana. La diferencia con Nova o Liquid es clara: aquí el control es total, tú eliges el proveedor, tú pagas, el código es público. Es la reacción natural a toda la delegación que hablamos antes: te dan la herramienta y las llaves.
Clara Vega: Del utilitario al placer. Paw-Paw es un mascote de escritorio gratuito para Mac que reacciona a cómo escribes y a tus clics, y con experiencia acumulada desbloqueas decenas de mascotes y más de cien objetos. Hay un extra de dos noventa y nueve.
Mateo Ruiz: Y en la misma onda creativa, Tonefold: un compositor de música con IA, open source bajo GPL, que genera MIDI editable por capas usando Claude u Ollama. Exportas MIDI, WAV y stems, y tiene un modo productor con aprobación. Fíjate: otra vez el punto de control humano, pero para hacer canciones.
Clara Vega: Y Markdoc, en la línea de herramientas de escritorio bien hechas: editor de Markdown colaborativo con fuente y preview lado a lado, comentarios, sugerencias y publicación directa a gist o repositorio de GitHub.
Mateo Ruiz: Ahora, hay una app de este grupo que merece más de un minuto por lo polémica: Off the Record, para macOS. Cambia tu voz en tiempo real para bloquear la transcripción por IA de notetakers y copilotos, con procesamiento cien por ciento local.
Clara Vega: Es la otra cara de la moneda. Llevamos dos bloques hablando de agentes que escuchan, leen y actúan. Off the Record dice: y si no quiero que me transcriban. Es el mismo escritorio, pero defendido. No sabemos qué tan robusto es contra todas las herramientas de transcripción —eso es lo que habría que poner a prueba— pero el problema que ataca es real y cada vez más común en reuniones.
Mateo Ruiz: Y para cerrar el bloque ligero, dos cosas rápidas. Tractionfold... TractionWave, perdón: predicción de atención en anuncios con mapas de calor por IA, dentro de Canva y Figma. Una evaluación gratis y luego créditos, sin suscripción.
Mateo Ruiz: Y Drunken Penguins: juegos de cartas de fiesta en el navegador, con sala por código y votos secretos, sin app; el barallo inicial es gratis, los paquetes cuestan un dólar cincuenta, y el "común" aquí es que todo esto devuelve control y disfrute al escritorio personal.
Clara Vega: Pasemos a infraestructura, que suena aburrido pero tiene de todo. Udon convierte un Mac con Apple Silicon en un home server: panel de control con contenedores, almacenamiento, terminal y un asistente de IA. Veintinueve dólares de pago único, con cinco días de prueba.
Mateo Ruiz: La tesis es aprovechar ese Mac que tienes apagado en un cajón. Comparado con montar un Linux a mano, Udon te da la capa de gestión con interfaz. La limitación obvia: es solo Apple Silicon, y el precio es de pago único, así que hay que ver cuánto mantenimiento recibe a largo plazo.
Clara Vega: Y si tu servidor está en casa, necesitas mostrarlo al mundo de forma segura. Tunnl.gg expone tu localhost vía SSH con una URL estable —tu clave SSH es tu identidad—, sin instalación, con HTTPS y log en vivo. El servidor es open source bajo MIT.
Mateo Ruiz: Simple y bien pensado: la identidad por clave elimina passwords y la URL estable evita regenerar enlaces cada vez. Y del túnel al servidor de videoconferencia: Tide es una alternativa self-hosted a Jitsi y Zoom, escrita en Go, con la media en tu propio servidor, grabación del lado del servidor y login con OIDC. Open source.
Clara Vega: Es la respuesta a "no quiero que mis videollamadas pasen por la nube de nadie". Combinas Udon más Tide más Tunnl y tienes tu propia videoconferencia, tus contenedores y tu acceso remoto, todo en hardware propio. Eso sí: con esto asumes tú la operación. Nobody te despierta a las tres de la mañana si tu servidor se cae... salvo que seas tú el administrador.
Mateo Ruiz: Y pasamos de servidores a algo que literalmente camina: Moonwalkers Dusk, zapatos motorizados que alcanzan hasta siete millas por hora, unos cuarenta por ciento más ligeros que antes, en tres tallas, a mil ciento noventa y nueve dólares. El primer lote es de doscientos pares y se envía el doce de octubre.
Clara Vega: Mil doscientos dólares por zapatos que te empujan al caminar. Es caro, es un lote minúsculo, y la entrega está anunciada pero no ocurrida todavía. Lo mencionamos porque es el extremo del espectro: la misma lógica de "ponle un agente o un motor a esto" aplicada al cuerpo. Y para cerrar con seguridad, Aegis: una app de seguridad personal con botón de SOS conectado a un despacho veinticuatro siete, GPS en vivo, audio y vídeo, perfil médico, PIN de coacción y contactos protectores.
Mateo Ruiz: Aquí la diferencia frente a una app de emergencia normal es el despacho humano detrás y el PIN de coacción, que te permite pedir ayuda disimuladamente. De nuevo el patrón del día: automatizar la parte rutinaria —detectar, localizar, avisar— y dejar la decisión crítica a personas.
Clara Vega: Vamos a cerrar, entonces, con el panorama entero. Si miras todo lo de hoy en bloque, hay una pregunta que atraviesa: ¿cuánto control humano se mantiene cuando los agentes escalan? Y la respuesta que emerge de estos lanzamientos no es "todo" ni "nada": es control rediseñado. Autopilotos que escalan solo lo necesario, pull requests para revisar, modos productor con aprobación, limiares en soporte.
Mateo Ruiz: Y del otro lado, contrapesos: routers donde los precios compiten por ti, benchmarks con llamadas reales, y hasta una app para que no te transcriban. El mercado está construyendo, a la vez, más autonomía y más maneras de verificarla. Eso, más un mascote de escritorio y unos zapatos eléctricos, porque tampoco hay que ser extremistas.
Clara Vega: Exacto. Gracias por escucharnos, soy Clara Vega.
Mateo Ruiz: Y yo Mateo Ruiz. Nos vemos en el próximo briefing.