0807 | OpenAI actualiza ChatGPT, juegos en HN, incidente de GitHub y Qwen lidera

||Download

Show notes

Clara Vega:Bienvenidos a Bri, el podcast Hacker News diario.

Este episodio es producido por Bri. Bri usa tecnología avanzada de IA para convertir los feeds que te importan en podcasts pensados para escuchar. Puedes escribirnos a hi@bri.so.

Transcript

Clara Vega: Bienvenidos a Bri, el podcast Hacker News diario. Soy Clara Vega.

Mateo Ruiz: Y yo soy Mateo Ruiz. Hoy tenemos un episodio cargado: desde una gran actualización de ChatGPT hasta noticias de GitHub, AMD, la FCC y un poco de Quake.

Clara Vega: Arrancamos charlando sobre la nueva versión de GPT-5.6 Sol para usuarios Plus y Pro, y seguimos con un juego que un autor compartió hace unos meses en Hacker News, más un incidente en la página de estado de GitHub.

Mateo Ruiz: También veremos a Qwen3.8 Max liderando un ranking en Inteligencia Artificial, la compra de la startup Taalas por AMD, y una decisión de la FCC que levantó el tope que limitaba a una sola empresa.

Clara Vega: Y cerramos con un runtime para agentes de codificación que entra a Y Combinator, el aniversario número 30 de Quake con nueva actualización, y una historia curiosa desde un teclado mecánico ultrabajo hasta un servicio de metales. Todo eso y más, a continuación.

Clara Vega: OpenAI acaba de mover pieza con ChatGPT, justo ayer, 6 de agosto. La actualización afecta sobre todo a cómo responde el modelo según el plan que tengas pagado. Para los usuarios de pago, los de Plus y Pro, el modelo que ya conocían, el GPT-5.6 Sol, promete ahora ser más fiable con los datos y dar respuestas más centradas.

Mateo Ruiz: Y entiendo que ese mismo modelo pasó a alimentar tanto las respuestas instantáneas como el razonamiento profundo. Además añaden un deslizador, algo así como un control para que tú elijas cuánto razonamiento quiere dedicar ChatGPT a cada respuesta. Ojo, porque eso también toca a los usuarios gratis.

Clara Vega: Exacto. Para los que están en el plan Free, el modelo por defecto pasa a ser otro, el GPT-5.6 Luna, con chats de texto ilimitados y un botón llamado Think para las preguntas que pidan más razonamiento. Y el artículo recalca una cifra potente: cada semana, mil millones de personas usan ChatGPT.

Mateo Ruiz: La propia OpenAI pone como ejemplo de respuesta más directa una pregunta de tráfico en San Francisco: si puedes ir en bici de Mission a Ocean Beach sin mojarte. El nuevo modelo responde, en dos palabras, que sí, que deberías mantenerte seco, mencionando unos vientos del oeste de 10 a 20 millas por hora y sugiriendo llevar una capa cortavientos ligera. La versión anterior daba una respuesta mucho más larga al mismo planteamiento.

Clara Vega: Y hay un matiz interesante: dicen que Sol adapta su nivel de detalle a cada pregunta, evita el formato innecesario y ofrece una corrección útil cuando simplemente estar de acuerdo no serviría. En Hacker News la reacción fue mixta. Un usuario, tosh, calificó de movimiento bastante badass que la Luna gratuita e ilimitada... y dice que Luna es muy buena. Pero otro, skybrian, opina que pagando le resulta barata para programar, aunque no acaba de fiarse para nada complicado y de hecho suele usar otra herramienta, Terra. Y eso provocó el rechazo de redox99, que dice que Terra es horrible y no es lo bastante barata para compensarlo, recomendando mejor Luna o Sol. También hubo quien tuvo una mala experiencia con Luna cuando salió.

Clara Vega: El siguiente es un experimento curioso que salió de la propia comunidad. Un desarrollador que publica como Wirbelwind en Hacker News, autor de una cosa llamada Scale X, compartió hace unos meses un juego de navegador en el que tú haces de human-in-the-loop de un agente de codificación de IA. Es decir, juegas aprobando o denegando los comandos que el agente propone, y todo bajo presión de tiempo.

Mateo Ruiz: Y tras añadir estadísticas, se juntaron datos de verdad. Más de 40.000 partidas y unas 409.000 decisiones individuales de aprobar o denegar. La cifra principal del artículo, firmado por Alex Wauters ayer 5 de agosto, es que de media el jugador falló 1 de cada 3 amenazas, con una precisión media del 66,3 por ciento. O sea, aun sabiendo que el juego te evaluaba, casi un tercio de las amenazas se te escapa.

Clara Vega: Y hay más números que cuentan la historia. El 32,9 por ciento de las sesiones terminó con puntuación negativa, porque las penalizaciones por aprobar una amenaza o bloquear un comando seguro superaron a lo que acertabas. Solo el 20,8 por ciento de los jugadores detectó todas las amenazas al mismo tiempo que bloqueaba como máximo 1 de cada 5 comandos seguros. Muchos otros lo lograron bloqueándolo casi todo, lo que les daba el título de Human Bottleneck.

Mateo Ruiz: Y en el otro extremo, un 7 por ciento aprobó todos los comandos sin excepción. El artículo los describe, con cierto humor, como grandes fans de una bandera que se llama dangerously-skip-permissions. Pero ojo, el propio autor pone la salvedad: esto era un juego, alrededor del 34 por ciento de los comandos eran amenazas, y en el trabajo diario de verdad esas amenazas aparecen raramente y la gente sabe que está siendo evaluada.

Clara Vega: De hecho el propio autor reconoce que, incluso con una advertencia inicial, se falló 1 de cada 3 amenazas, y que el historial de comandos, situado justo encima de los comandos de npm, tiende a ignorarse. Lo interesante es que dice haber incorporado el feedback del hilo anterior, en particular un punto concreto sobre esos comandos npm run. Un recordatorio de que la supervisión humana sigue siendo un eslabón frágil.

Clara Vega: Otro tema, y esta vez con GitHub de protagonista. Ayer, 6 de agosto, la página de estado de GitHub publicó un incidente bajo el título de Incidente con Actions. La historia que circula por Hacker News lo resume como una degradación de disponibilidad en GitHub Actions y en Pages. Y según las actualizaciones oficiales, los errores afectaban sobre todo a Actions: algunas ejecuciones de workflows no lograban ni iniciarse, o fallaban a mitad de camino, y algunas solicitudes a la API REST de Actions devolvían errores.

Mateo Ruiz: Y durante esa misma ventana, Pages alternó entre rendimiento degradado y operación normal. En la última actualización documentada, la cosa seguía sin estar resuelta: los runs seguían fallando o retrasándose al iniciar, algunos jobs en cola podían agotar su tiempo de espera, había errores en la API de Actions, y hasta las migraciones con GitHub Enterprise Importer podían fallar. Los ingenieros habían aplicado ya varias mitigaciones y estaban desplegando un arreglo adicional.

Clara Vega: Lo que más gracia hace en el hilo es el dato que aporta un usuario, KyleTheDev: este era el incidente número 6 del mes de agosto, justamente el día 6. Y decía que ese patrón no presagiaba nada bueno. Pero otro, paularmstrong, matizó que cuatro de esos incidentes estaban relacionados con inteligencia artificial o con Copilot, así que en realidad sería un único incidente de larga duración, con un cincuenta por ciento de probabilidades de caída.

Mateo Ruiz: Y luego está la gente escéptica. Un usuario llamado Insanity se mostró escéptico ante la tendencia a culpar a la IA o al escalado, recordando que GitHub pertenece a uno de los principales hyperscalers, es decir, a las grandes infraestructuras de nube. Y anticipó con ironía que pronto será más noticioso publicar que GitHub está arriba. Otro, newtonianrules, preguntó directamente si Microsoft despidió a la gente que trabajaba en las funciones de GitHub... justo en pleno incidente.

Clara Vega: Y para cerrar, un movimiento en el ranking de modelos de IA. Un usuario llamado apitman envió a Hacker News una historia basada en artificialanalysis.ai: un modelo llamado Qwen3.8 Max aparece ahora como el mejor modelo global según el índice agéntico de Artificial Analysis. La propia plataforma se describe como una comparación y análisis de modelos de IA y proveedores de hosting de API, con benchmarks independientes de calidad, precio, velocidad de salida y latencia.

Mateo Ruiz: Aquí hay un detalle que conviene entender. Ese índice agéntico viene de un índice más amplio, el Intelligence Index, que integra nueve evaluaciones distintas sobre 26 de los 595 modelos que analizan. Y en el mismo changelog de la plataforma, ya el 24 de julio, describían a otro modelo, Claude Opus 5, como el nuevo líder en trabajo de conocimiento agéntico. Así que el liderazgo cambió de manos en cuestión de días.

Clara Vega: Ahora, lo más interesante es la polémica de la propia discusión. Un usuario, embedding-shape, nota una rareza: la página de agentes de código de esa misma plataforma no menciona la palabra Qwen ni una sola vez, pese a que el índice la proclama la mejor. Y otro usuario, scrlk, aclara el porqué: son benchmarks distintos. El índice agéntico es la media ponderada de los benchmarks de capacidades agénticas, mientras que el índice de agentes de código es otra cosa que incorpora sus propias evaluaciones. El Qwen3.8 Max puntúa 55,4 en el índice agéntico, pero no ha sido probado en el de agentes de código.

Mateo Ruiz: Y apitman, el que mandó la historia, añade algo importante: el agente de código es modelo más herramienta, el harness que lo envuelve, y allí hay muchos menos modelos representados. Aunque él mismo cree, con dudas explícitas, que el índice agéntico sigue siendo la métrica a mirar para el rendimiento de código. En resumen: un liderazgo nuevo en un índice concreto, pero que no necesariamente se traduce a todas las categorías de evaluación. La lección de hoy queda clara: los rankings de IA hay que leerlos con lupa, mirando qué pruebas alimenta cada número y cuáles no.

Clara Vega: Empecemos por una apuesta grande en hardware de inteligencia artificial. AMD ha comprado a Taalas, una startup con sede en Toronto fundada en 2023, y el anuncio se hizo al cierre del mercado del jueves 6 de agosto de 2026, según The Register. No es una compra de talento al uso: se trata de una adquisición real, aunque AMD no ha revelado los términos del acuerdo.

Mateo Ruiz: Lo interesante es que Taalas llega con una idea bastante distinta a la de los chips convencionales. En lugar de almacenar los pesos del modelo en memorias externas como la HBM, sus chips graban esos pesos directamente en el silicio. Es decir, convierten el circuito en algo específico para un modelo concreto, lo que llaman un circuito integrado de modelo.

Clara Vega: Y de eso obtienen una velocidad considerable. En febrero, Taalas mostró su primer chip de prueba, el HC1, fabricado en el proceso de 6 nanómetros de TSMC, que servía el modelo Llama 3.1 de Meta a casi 17.000 tokens por segundo. Según los benchmarks que anunciaron entonces, eso era 48 veces más rápido que las GPU de Nvidia y 8 veces y media más rápido que los aceleradores de Cerebras.

Mateo Ruiz: La siguiente iteración, el HC2, apunta a 20.000 millones de parámetros por chip, y con paralelismo bastarían unos 50 aceleradores para manejar un modelo de un billón de parámetros, frente a las docenas de GPU o al menos 2000 de las unidades que usa Nvidia en sus sistemas LPX. Es una diferencia enorme en la cantidad de hardware necesaria.

Clara Vega: El contexto también es clave. Esto suena al acuerdo de licencia de 20.000 millones de dólares que Nvidia firmó con Groq en diciembre: la pelea por hacer más rápidos y baratos los servicios de inferencia premium, esos que alimentan a agentes de IA y asistentes de código.

Mateo Ruiz: Y el plan de AMD es combinar estos aceleradores con sus propios racks Helios basados en Instinct, en una arquitectura donde las GPU se encargan de procesar el prompt inicial y la generación de tokens se descarga a los chips de Taalas. Una división de trabajo que, en teoría, deja a cada pieza haciendo lo que mejor sabe.

Clara Vega: Cambiamos de tema, pero nos movemos también en territorio de debates filosóficos. Hay un artículo en Hacker News que plantea que el gusto es lo único que queda en el software, y la discusión no se quedó corta. Un comentarista señaló algo punzante: el mercado cronometró a dos productos con el mismo cronómetro y no vio la diferencia, el gusto no aparece en el diff. Y de ahí preguntó si usar el gusto como estrella guía garantiza el fracaso, o si el software, cuando el mercado lo clona, ya no tiene forma de entrar.

Mateo Ruiz: Otro usuario respondió con la analogía de la alta costura. Alguien puede replicar a mano una prenda de diseño, incluso mejorarla, pero los compradores siguen valorando el origen, aunque sea un mercado pequeño. Quizá el software se mueva hacia ahí después de la mercantilización: usuarios que prefieran una pieza artesanal.

Clara Vega: Hubo quien recordó que esto ya era cierto en menor medida durante décadas, citando el célebre ensayo “Worse Is Better”. Y otro usuario matizó que, si por gusto entendemos mantenibilidad, ocurre exactamente lo contrario: una startup que “vibecodea” sin pensar puede terminar con una base de código que no puede mantener ni refactorizar, un producto que no avanza. Aunque también reconoció que aterrizar código en proyectos grandes sigue siendo difícil.

Mateo Ruiz: Y entonces llegó la crítica más directa del hilo. Un comentarista dice estar cansado de una era de ingenieros abatidos que solo quieren lo simple, y valora la ambición de quienes exploran fronteras nuevas. Pero no le convence el artículo: critica el “esto es suficientemente bueno” como pensamiento mágico, como si los modelos de lenguaje hubieran resuelto todo y la caja produjera sola. Y recuerda que, en las fábricas, construir los procesos industriales requiere trabajo real.

Clara Vega: Pasamos a un movimiento regulatorio grande en Estados Unidos. La Comisión Federal de Comunicaciones votó el jueves eliminar el tope que impedía a una sola empresa poseer emisoras que alcanzaran juntas a más del 39 por ciento de los hogares con televisión del país. Según NBC News, la votación fue de 2 a 1, y reemplaza esa regla, vigente desde 2004, por un enfoque caso por caso. La medida, dicen, allana el camino a una mayor consolidación corporativa en la industria de medios.

Mateo Ruiz: El presidente de la FCC, Brendan Carr, republicano designado al inicio del segundo mandato de Donald Trump, defendió la decisión. En un artículo de opinión calificó el límite de obsoleto, y sostuvo que ya no restringe el poder de los programadores nacionales, sino que impide a los radiodifusores locales competir en igualdad de condiciones. Carr afirma además que la FCC tiene autoridad legal para eliminar la regla.

Clara Vega: Pero esa posición, probablemente, enfrente desafíos judiciales, en parte porque el tope está codificado en la ley federal. La comisionada demócrata Anna M. Gomez, única demócrata de la comisión, fue tajante: calificó la votación de ilegal en su faz, y dijo que eliminar el tope no libera a los radiodifusores locales de la presión económica, solo cambia quién ejerce la presión.

Mateo Ruiz: El grupo progresista Free Press anunció que planea demandar por lo que llama un agarre de poder ilegal. Y en la discusión de Hacker News, un usuario resumió lo que muchos parecen pensar: que la medida es descaradamente ilegal y que probablemente los tribunales la reviertan.

Clara Vega: Para cerrar, una historia más ligera pero con una buena discusión detrás. Un desarrollador, Fabian Giesen, publicó en el Mastodon de desarrollo de juegos que, tras una actualización reciente, su teléfono ha empezado a detectar que sale a correr como si fuera alguien que le arrebata el teléfono y sale corriendo. ¿El resultado? La pantalla se bloquea al instante y lo expulsa de la aplicación que usa para llevar el ritmo de sus carreras.

Mateo Ruiz: Esa frustración tan concreta abrió el debate en Hacker News sobre si la función está justificada. Alguien preguntó si arrebatar un teléfono y salir corriendo es un problema lo suficientemente común en algunas regiones como para que valga la pena, o si es una función que persigue miedos a costa de inconvenientes como el que describió.

Clara Vega: La respuesta fue un sí absoluto, con un enlace a una noticia sobre robo de teléfonos en Londres. Y eso provocó un momento divertido: otro usuario comentó que, al ver que era una cadena canadiense, su primera reacción fue pensar en London, Ontario, porque vive a 20 minutos de allí, donde 70.000 robos al año le habrían parecido una locura. Al darse cuenta de que se trataba de Londres, en el Reino Unido, la cantidad le seguía pareciendo una locura.

Mateo Ruiz: Y el punto quedó reforzado desde otro continente: un usuario señaló que en Brasil el problema es tan grande que el gobierno tiene una aplicación oficial para reportar incidentes de robo de teléfono. La ironía no pasó desapercibida: alguien preguntó si también existe un servicio de autoservicio para reportar robos. Al final, lo que parece una función absurda para un corredor en Norteamérica es, en otros mercados, una protección real contra un delito omnipresente.

Clara Vega: Empecemos con Herdr, el runtime para agentes de codificación que acaba de anunciar que se une a Y Combinator. Lo firma la única persona detrás del proyecto, Can Celik, y entra en el batch F26 de YC. Cuenta que llevaba cuatro meses buscando trabajo cuando se dio cuenta de que el verdadero cuello de botella de sus proyectos era él mismo, y construyó un runtime donde los agentes viven en paneles de terminal persistentes.

Mateo Ruiz: Y un detalle que me parece importante: el proyecto declara 25.000 estrellas y 340.000 descargas, con más de 500 plugins un mes después del estreno del marketplace. Ya hay clientes hechos por terceros, como una extensión para Raycast, un Stream Deck con botones e incluso una app para iOS.

Clara Vega: Lo interesante para quien esté pensando en adoptarlo es que el runtime sigue siendo gratuito y con licencia Apache-2.0. De hecho, Celik dice que lo cambió recientemente de AGPL a Apache justamente para que cualquiera pueda usarlo sin problemas de licencias. Su plan declarado es formar un equipo pequeño, mantener el núcleo reducido y seguir construyendo sobre ese runtime abierto.

Mateo Ruiz: Eso de las licencias es la clave, porque la discusión en Hacker News gira casi toda alrededor del dinero. Un usuario fan de Herdr y de YC admite que teme lo que significa financiación de capital de riesgo: comercialización y ese deterioro típico de producto que persigue dinero. Y pone de ejemplo a Warp, un terminal limpio que, en sus palabras, se convirtió en un desastre persiguiendo dinero.

Clara Vega: Otro comentario más directo dice que probablemente ya es el momento de buscar una alternativa, porque se ve hacia dónde irá el proyecto en un año. Y la respuesta que se le da es que cualquier usuario avanzado de Herdr es perfectamente capaz de mantener un fork propio del código.

Mateo Ruiz: Pasamos de una historia del presente a una del pasado. id Software publicó el update de aniversario de Quake, 30 años después de su lanzamiento, y lo hizo en colaboración con el estudio MachineGames. La buena noticia es que es gratuito para quienes ya tengan Quake en cualquiera de sus versiones modernas: Xbox, Steam, PlayStation, Game Pass, y también en Nintendo Switch.

Clara Vega: El contenido nuevo se llama Dawn of the Machine, y es un episodio que continúa el trabajo que MachineGames ya hizo en las anteriores expansiones, Dimension of the Machine y Dimensions of the Past. Trae 19 mapas nuevos, banda sonora nueva, secretos, un hub de episodio dedicado, un mapa nuevo de deathmatch y tres logros.

Mateo Ruiz: La premisa tiene su miga: el protagonista, Ranger, queda atrapado en una dimensión de ilusión infinita, reviviendo ciclos violentos una y otra vez y muriendo miles de veces. La única forma de romper el bucle es destruir la llamada Nightmare Machine. Y ese concepto se traduce en mecánicas reales: un bucle de niveles con runas, mejoras persistentes de salud y munición, enemigos que reaparecen o se transforman al morir, y cambios de dimensión para puzles.

Clara Vega: Añade también enemigos nuevos, como el Rocket Ogre o el Blood Shambler, y armas como el hacha llamada Super Axe y la Laser Cannon. Y de regalo, un id Vault con material de desarrollo y niveles jugables, más un menú de trucos.

Mateo Ruiz: Y ojo, hay un cambio que afecta a los modders y no al jugador normal: antes las cadenas de texto de localización vivían en un archivo que ahora se traslada al PAK principal de Quake. Los motores de terceros que leían ese archivo van a tener que actualizarse para leer el nuevo formato. Eso significa que los mods tendrán que adaptarse, aunque por otro lado ahora pueden meter su propia localización dentro de su propio PAK.

Clara Vega: Seguimos con un proyecto que la comunidad recibió con muchísimo interés: un teclado mecánico ultrabajo llamado Altar II, presentado por su creador aemerson_ en Hacker News. Quiere ser un sustituto directo del Magic Keyboard de Apple, y de hecho su autor lo describe como el teclado que le gustaría que Apple hubiera fabricado.

Mateo Ruiz: Llevarlo a cabo le costó casi dos años, y los grandes obstáculos fueron dos: meter una batería de tamaño razonable en un chasis tan fino, y optimizar el consumo de energía sin arruinar la experiencia de usuario. Además, cuenta que no había espacio en la cara inferior de la placa para colocar componentes. Y este no es su primer proyecto: hace unos cuatro años publicó su primer teclado en Hacker News, la respuesta le animó a dejar su trabajo y ahora se dedica a esto a tiempo completo.

Clara Vega: La cifra que importa es el grosor: 4,75 milímetros para un teclado totalmente mecánico. Para que te hagas a la idea, el Magic Keyboard de Apple mide unos 10 milímetros pero no es mecánico, y la gran mayoría de teclados mecánicos del mercado se mueven entre los 20 y los 30 milímetros. El truco para conseguirlo es un muelle de tensión precargado colocado de lado en lugar de en vertical, lo que permite un recorrido de tecla de solo 1,8 milímetros.

Mateo Ruiz: Es de construcción en acero, cuesta 349 dólares, y si haces una reserva ahora te sale por 249, un descuento de cien dólares. Entre sus funciones destacan un dial magnéticamente desmontable, clicable e intercambiable, y una optimización de batería muy agresiva. Si Apple no mira por sus teclados, está claro que hay quien lo hace por su cuenta.

Clara Vega: Cerramos con ProvenMetal, un proyecto respaldado por Y Combinator que se presenta como un servicio estadounidense de placas de circuito impreso llave en mano. La idea es que el cliente manda sus archivos de diseño o sus especificaciones y recibe las placas ya ensambladas, en cuestión de días. Y hay un dato de contexto que lo explica todo: Estados Unidos pasó de fabricar el 30% de la producción mundial de placas en el año 2000 a solo el 4%, mientras que China domina hoy con el 55%.

Mateo Ruiz: Detrás están Will y Johnny, que empezaron ensamblando en su garaje con equipos semiprofesionales. Descubrieron que el cuello de botella real no era el ensamblaje, sino todo lo que ocurre antes: la cotización, la revisión del diseño para asegurar que se puede fabricar, y la compra de componentes. Tanto que llegaron a dedicar un 90% de su tiempo a ese trabajo de ensamblado.

Clara Vega: Su solución es automatizar ese proceso: compran materiales usando plug-ins de los programas de diseño KiCAD y Altium, guardan piezas en su sede de San Francisco, y usan un sistema propio llamado Fable 5 para revisar automáticamente si un diseño se puede fabricar según las capacidades de cada fabricante. Y los números que manejan son llamativos: unos 70.000 dólares en 11 pedidos en solo seis semanas, con el primer encargo pagado en menos de una semana y un turno estándar de siete días.

Mateo Ruiz: En el hilo hay opiniones escépticas, claro. Un usuario lo compara con un moonshot: esto requiere experiencia real de fabricación y, sin patrocinadores comprometidos, fácilmente se queda en material de hobby. Pero también reconoce que apoyarse en defensa les da margen, porque ahí no compiten directamente con China en precio. Will responde que empezar por el sector de defensa les dará capacidades para otras verticales y para optimizar costes, aunque admite sin rodeos que es imposible ganarle a China de entrada en precio.

Clara Vega: Y alguien pregunta por alternativas en Europa, porque no todo es Estados Unidos. Will menciona a Eurocircuits, y otro usuario añade Aisler y Beta-Layout, atribuyendo sus precios más altos a un contexto donde no existe esa competencia china. En el fondo, ProvenMetal apuesta por competir en velocidad y en calidad, no en precio, sabiendo de antemano que ese campo de batalla está perdido contra Asia.

Clara Vega: Un ingeniero acaba de publicar en código abierto un SDK llamado Channels, pensado para llevar cualquier agente de inteligencia artificial a cualquier plataforma de chat: Slack, Microsoft Teams, Discord, Telegram, todas con una interfaz interactiva nativa. Y lo más interesante es que no es un proyecto pensado para los grandes agentes corporativos, sino justo al revés.

Mateo Ruiz: Exacto. El autor cuenta que dentro de su empresa han visto surgir muchísimos agentes pequeños y específicos. Puso ejemplos muy concretos: uno que envuelve la línea de comandos de DoorDash para pedir el almuerzo de la oficina, otro que combina dos herramientas para el triaje de incidentes, e incluso uno que genera vídeos de marketing bajo demanda a partir de los cambios que se fusionan en el repositorio de código. Y hay más que combinan servicios como PostHog, Notion o Linear.

Clara Vega: Y la apuesta de fondo es esa: el propio autor confiesa que antes creía que el futuro estaba en llevar los agentes a la web, pero cada vez está más convencido de que las interfaces de chat son el hogar más natural para los agentes útiles. Por eso el SDK está construido sobre un estándar llamado AG-UI, de modo que cualquier agente que emita en ese formato puede llevarse directamente a Slack o Teams.

Mateo Ruiz: Ahora bien, hay un matiz importante. Alguien preguntó por la integración con WhatsApp, y la respuesta es que por ahora solo está soportada en la parte de código abierto de los SDKs. El soporte completo dentro del servicio alojado está todavía en la hoja de ruta.

Clara Vega: Y para entender cómo funciona, hay que ver que tratan el "canal" como una capa con cuatro piezas. Una de ellas son los adaptadores, que normalizan los webhooks y las peculiaridades de cada plataforma en una forma única de evento. Otra gestiona la entrega, el orden de los mensajes y las reconexiones, y lo hace con un mecanismo que primero publica la tarjeta de aprobación, acusa la entrega y después reanuda. Así, si el agente necesita la aprobación de una persona para continuar, el sistema no pierde la pista de dónde quedó.

Mateo Ruiz: Entonces, en resumen: es un lanzamiento público del SDK, orientado a esos agentes pequeños y de nicho, y con una arquitectura que intenta resolver el lío de soportar muchas plataformas distintas sin duplicar el trabajo.

Clara Vega: Pasamos al mundo de la seguridad, y esta es una noticia con una parte positiva y una parte inquietante. El sitio Have I Been Pwned, el servicio que rastrea si tus datos han aparecido en filtraciones, ha incorporado al Gobierno de Nepal en su servicio gratuito para gobiernos. Es el gobierno número cuarenta y siete en unirse.

Mateo Ruiz: En concreto, el Centro Nacional de Ciberseguridad de Nepal va a poder monitorizar todos los dominios gubernamentales del país contra los datos de Have I Been Pwned. Es decir, van a poder detectar si las direcciones de correo del gobierno aparecen en una nueva filtración y responder antes de que los atacantes aprovechen credenciales ya comprometidas.

Clara Vega: Y la parte positiva la ha señalado un comentarista en la conversación, que dice que esta es una buena noticia dado el estado actual de los servicios informáticos del gobierno nepalí. Y entonces pone ejemplos que te hielan la sangre. Por ejemplo, la página web para pedir cita de renovación de pasaporte tiene un fallo que te obliga a cambiar tu zona horaria local o forzarla manualmente a la de Katmandú.

Mateo Ruiz: Eso suena a un problema menor, pero el siguiente ejemplo no lo es. Cuenta que, al interactuar con sitios web del gobierno nepalí, ha visto endpoints que ni siquiera hacen un saneamiento básico de las entradas, lo que permite ejecutar consultas arbitrarias sobre datos biométricos. O sea, una puerta abierta a bases de datos con información sensible.

Clara Vega: Y añade un dato aún más preocupante: según lo que ha escuchado dentro de la industria tecnológica, esto es algo común. De hecho, menciona que alguien encontró una vulnerabilidad que aparentemente se dejó sin parchear a propósito, probablemente para facilitar la corrupción.

Mateo Ruiz: La conversación incluso deriva hacia el contexto político, porque alguien pregunta si se trata del nuevo gobierno, tras el derrocamiento del anterior el año pasado. Y la respuesta de otro comentarista es, con un poco de humor seco, que no conoce otros gobiernos de Nepal, dejando claro que, sea cual sea el gobierno, los problemas de fondo en la seguridad informática parecen persistir.

Clara Vega: Así que esta incorporación a Have I Been Pwned es un avance real para la monitorización de amenazas, pero llega sobre una base digital que sigue siendo frágil. Y con eso cerramos este bloque, seguimos.

Clara Vega: Y con eso cerramos el repaso de hoy. Arrancamos con la nueva actualización de GPT-5.6 Sol para ChatGPT, seguimos con el juego del autor de Scale X, el incidente en el estado de GitHub y el ascenso de Qwen3.8 Max como mejor modelo en Artificial Analysis.

Mateo Ruiz: También repasamos la compra de Taalas por parte de AMD, el debate sobre el gusto de los economistas y la decisión de la FCC de eliminar el tope para una sola empresa.

Clara Vega: Además hablamos del hilo de Fabian Giesen en Gamedev Mastodon, Herdr uniéndose a Y Combinator, el aniversario treinta de Quake con su colaboración con Bethesda, y proyectos como el teclado Altar II, Proton... perdón, ProvenMetal y el SDK de Channels.

Mateo Ruiz: Y cerramos con la novedad de que el Gobierno de Nepal se sumó al servicio gratuito de Havelook para gobiernos. Nos escuchamos en la próxima. ¡Hasta luego!