1009 | IA em alta: agentes, modelos e o que mais chegou esta semana

||Download

Show notes

Uma volta rápida pelas novidades da semana em IA, apps e ferramentas: das plataformas de agentes e modelos novos às curiosidades de hardware e apps do dia a dia.

Linha do tempo

  • 00:00:04 Abertura
  • 00:00:49 Modelos e custos de IA
  • 00:03:46 IA de voz em teste real
  • 00:05:07 Agentes de código: orquestração e supervisão
  • 00:08:19 Agentes nas suas mãos e IA pessoal proativa
  • 00:09:59 IA dentro do fluxo de trabalho
  • 00:12:08 Ferramentas de desktop, privacidade e self-hosted
  • 00:15:38 SEO, julgamento e trabalho assistido
  • 00:19:01 Presença, idiomas e câmera lenta
  • 00:21:41 Hardware e segurança pessoal
  • 00:23:27 Para jogar no navegador
  • 00:23:57 Encerramento

Links relacionados

Este episódio é produzido pela Bri. O Bri usa tecnologia avançada de IA para transformar os feeds importantes para você em podcasts feitos para ouvir. Fale conosco em hi@bri.so.

Transcript

Sofia Almeida: Olá, você está na sua briefing diária de lançamentos, eu sou a Sofia Almeida.

Rafael Costa: E eu sou o Rafael Costa. A ideia de hoje é simples: em vez de listar dezenas de produtos soltos, a gente escolheu os que têm o problema do usuário mais claro, uma solução que se diferencia de verdade, capacidades concretas, preço ou disponibilidade definidos, e algum sinal de quem está por trás. E quando falamos de números ou promessas dos criadores, a gente trata como afirmação, não como resultado verificado.

Sofia Almeida: E o fio que costura tudo hoje é um só: IA que trabalha, cobra menos, e chega cada vez mais perto de parecer gente. Começando pelo preço, porque é onde todo mundo sente.

Rafael Costa: Então vamos direto ao ponto. A Anthropic anunciou o Claude Haiku 5.5, que é o modelo pequeno da família. Os dois números que importam: mais rápido e cerca de 75% mais barato que o que veio antes.

Sofia Almeida: E tem um detalhe que me parece o mais interessante: é o primeiro Haiku com ajuste de esforço. Ou seja, você consegue dizer ao modelo quanto "pensamento" ele deve gastar naquela tarefa.

Rafael Costa: Isso muda a lógica de custo de forma prática. Num pipeline de alto volume, a maioria das chamadas não precisa do modelo mais caro e mais profundo. Se você pode calibrar o esforço por chamada, o modelo pequeno deixa de ser só "o barato que responde qualquer coisa" e vira uma ferramenta que você controla com precisão.

Sofia Almeida: Quem é pra quem? Para quem roda classificação, sumarização, triagem em escala, aqueles workloads onde você processa milhares de itens por hora. Nesses casos, 75% menos por chamada não é detalhe, é a diferença entre o projeto caber no orçamento ou não.

Rafael Costa: E vale a honestidade de sempre: essa economia é afirmação da Anthropic, não um benchmark independente que a gente possa confirmar aqui. E "modelo pequeno" sempre tem limite — em raciocínio complexo, o Haiku provavelmente não substitui os maiores. O que a Anthropic está dizendo é que para alto volume, ele é a escolha certa.

Sofia Almeida: Agora, o outro lado da mesma moeda: e se você nem quiser escolher provedor? Aí entra o Liquid Inference, que é um roteador de LLM com uma proposta bem provocativa.

Rafael Costa: A ideia é que os provedores competem por preço a cada prompt. Você manda a requisição, e o roteador despacha para quem estiver oferecendo melhor naquele momento. E do seu lado, a integração não muda: a API é compatível com os formatos da OpenAI e da Anthropic.

Sofia Almeida: Isso é importante porque elimina a dor clássica de multi-provedor: reescrever código, gerenciar chaves de vários lugares, lidar com formatos diferentes. Aqui o cliente mantém o código e o roteador cuida da economia.

Rafael Costa: E tem disponibilidade concreta: vinte dólares de crédito grátis para os quinhentos primeiros usuários. Ou seja, dá para testar de verdade antes de comprometer qualquer coisa.

Sofia Almeida: O que fica em aberto? Duas coisas. Primeiro, competir por preço a cada prompt pode significar variabilidade de qualidade entre chamadas — o mesmo prompt pode ir para modelos diferentes. Segundo, a gente não sabe como funciona a alocação exata, se há garantias de modelo mínimo. Mas a tese é clara: preço de IA está virando commodity, e ferramentas que tratam isso como mercado estão apostando nisso.

Rafael Costa: E quando a gente fala de escolher modelo, tem uma pergunta que quase ninguém consegue responder bem: qual modelo de voz é melhor? Aí entra um benchmark que tentou responder isso em condições bem pouco laboratoriais.

Sofia Almeida: Cekura Bench testou nove modelos de fala-para-fala em chamadas reais de telefone — oitenta e dois cenários. E os resultados contam uma história interessante.

Rafael Costa: O melhor modelo foi o GPT Realtime 2.1, com 79,3%. Bom número... mas aí vem a reviravolta: uma cascata — que é quando você encadeia componentes em vez de usar um modelo ponta a ponta — bateu todos, com 82,9%.

Sofia Almeida: Isso é relevante por duas razões. Primeiro, ninguém passou dos 83%. Em chamadas de telefone reais, com ruído, interrupções, fala natural, ainda há muito espaço para falhar. Segundo, a arquitetura "na moda" — o modelo único ponta a ponta — perdeu para a arquitetura mais tradicional, a cascata.

Rafael Costa: E conecta com o que vimos no tópico anterior: a escolha de modelo importa, mas a arquitetura ao redor importa tanto quanto. Você não resolve voz só comprando o modelo melhor; resolve montando o sistema certo.

Sofia Almeida: E dos modelos de voz, pulemos para os agentes de código — porque é aí que está a maior concentração de lançamentos de hoje. Orquestrar e vigiar agentes de código virou uma categoria própria, com ferramentas para cada parte do problema.

Rafael Costa: Vamos por partes, mas mantendo a comparação viva. O primeiro problema é operacional: o agente precisa usar a interface gráfica do computador. Aí entra o offroad, que dá ao agente de código uma segunda conta do macOS, já logada, para trabalhar com GUI.

Sofia Almeida: O detalhe esperto é que sua tela fica livre. O agente opera numa sessão separada, e você continua trabalhando sem ver o cursor se mexendo sozinho. É MIT, e roda em Apple Silicon.

Rafael Costa: O segundo problema é supervisão em sessões longas. O pmtui é um supervisor escrito em Rust, sobre tmux, para sessões de Claude e Codex que rodam por muito tempo.

Sofia Almeida: E aqui tem uma ideia que eu acho a mais madura do dia: o autopiloto. O supervisor resolve sozinho as decisões rotineiras e só escala para o humano o que realmente precisa de julgamento humano.

Rafael Costa: Isso é exatamente o gargalo real. Quem roda agentes por horas sabe: o agente não trava por falta de capacidade, trava porque para no meio e pergunta. O pmtui ataca esse tempo de espera. A limitação é óbvia: o critério do que é "rotineiro" versus "precisa de humano" é a parte difícil, e cada erro do autopiloto é uma decisão errada tomada sem você.

Sofia Almeida: O terceiro problema é o agente em si. O Nova CLI coloca um desenvolvedor de IA direto no terminal: ele lê o projeto, edita o código, roda os testes e o build.

Rafael Costa: E no comercial: nos planos pagos, são mais de 160 modelos incluídos, sem você precisar gerenciar chaves de API. Isso ecoa a conversa do Liquid Inference — a indústria inteira está tentando remover o atrito de escolher e pagar por modelo.

Sofia Almeida: E aí, na ponta mais ambiciosa da categoria, dois desktops de orquestração, um para cada sistema. No Mac, o OpenSwarm: enxames de agentes trabalhando em paralelo, com contexto compartilhado, e acesso a navegador e apps. É gratuito, mas está em lista de espera — ou seja, ainda não dá para simplesmente baixar e testar.

Rafael Costa: No Windows, o Clippo: um canvas visual para orquestrar agentes como Claude Code e Codex, com memória local, sem nuvem e sem login. Grátis na Microsoft Store.

Sofia Almeida: A comparação entre os dois é instrutiva. O OpenSwarm aposta em escala — muitos agentes em paralelo. O Clippo aposta no controle visual e na privacidade — você vê o fluxo num canvas, e a memória fica na sua máquina. São apostas diferentes sobre como humanos vão gerenciar múltiplos agentes.

Rafael Costa: E o que ainda não sabemos em toda essa categoria: se enxames de agentes entregam mais que um agente bem supervisionado, e quanto custa em tokens manter dez agentes com contexto compartilhado. Ninguém desses lançamentos responde isso.

Sofia Almeida: E se o agente está trabalhando enquanto você está fora do computador, como você o controla? Aí entram dois produtos que levam a IA para longe do teclado.

Rafael Costa: O BotBus gerencia agentes de código — Codex, Claude Code e outros — do celular ou do Apple Watch. Com aprovações no toque, criptografia ponta a ponta, e funciona com máquinas em macOS, Linux e Windows.

Sofia Almeida: O modelo mental é: você lança um agente para fazer uma tarefa longa, sai para almoçar, e quando ele pedir aprovação, o Watch vibra e você aprova dali. É a evolução natural do que o pmtui faz no terminal, só que para o bolso.

Rafael Costa: Agora, o Hark Pro vai além: é uma IA pessoal proativa que age por você em e-mail, calendário, compras e viagens. E tem um detalhe arquitetural que merece destaque: ela roda num computador na nuvem próprio, com credenciais criptografadas e — isso é importante — ação visível.

Sofia Almeida: "Ação visível" é a resposta à pergunta óbvia: como confio numa IA que compra e agenda por mim? Você enxerga o que ela fez. Mas a pergunta que fica: delegar compras e viagens é um nível de confiança muito acima de aprovar um diff de código. O que acontece quando ela erra uma compra? Isso o lançamento não responde.

Rafael Costa: E os dois produtos, juntos, desenham o mesmo espectro: o BotBus mantém o humano no loop de forma confortável; o Hark Pro empurra o humano para o papel de revisor. Ninguém sabe ainda onde está o ponto certo.

Sofia Almeida: E falando de onde a IA deve morar, a resposta mais forte do dia veio de quem mora dentro dos seus apps de trabalho.

Rafael Costa: O Claude agora funciona dentro do Google Workspace — Docs, Sheets e Slides. É beta, em planos pagos. Ele edita os arquivos ali dentro, e você também pode criar e editar arquivos a partir da interface do Claude.

Sofia Almeida: Isso é significativo porque muda o custo de fricção para quase zero. Você não copia texto para outro app, não exporta, não cola de volta. A IA está onde o documento já está.

Rafael Costa: O limite claro: é beta, e restrito a planos pagos. E fica a pergunta de quanto contexto do seu workspace inteiro o Claude consegue enxergar versus só o arquivo aberto.

Sofia Almeida: No mesmo espírito, mas no fluxo de engenharia: o Polylane chegou à Vercel Marketplace como um engenheiro de plantão por IA.

Rafael Costa: O fluxo é concreto: quando aparece uma regressão, o Polylane investiga — e aqui o detalhe que separa isso de hype: ele produz evidências da investigação — e abre um pull request com a correção, para um humano revisar.

Sofia Almeida: O humano revisar é a parte chave. Ele não faz merge sozinho. É o mesmo princípio do pmtui escalando o que precisa de julgamento humano: automatizar a investigação, manter o humano na decisão final.

Rafael Costa: E para fechar esse bloco, a parte que ninguém ama mas todo mundo precisa: observabilidade. O Kloudmate 2.0 é uma plataforma full-stack com quatro agentes de IA — Assistant, Builder, Investigator e Docs — para análise de causa raiz e construção de dashboards. É nativa em OpenTelemetry.

Sofia Almeida: O Investigator para RCA é o uso mais provocativo: em vez de você caçar a causa de um incidente, o agente caça e apresenta. A ressalva de sempre: RCA automático é bom enquanto o agente não alucinar uma causa plausível mas errada. Ter os quatro agentes no mesmo painel, nativo OpenTelemetry, é o diferencial de integração.

Rafael Costa: Vamos agora para um bloco sobre controle e privacidade, porque depois de falar de IA com acesso a credenciais, é um contraponto natural.

Sofia Almeida: Começando pelo mais cotidiano: o Side é um painel de IA ao lado do Dock no macOS, multi-provedores, num chat só. Atalho ⌘⇧Espaço para abrir. Gratuito e open source, licença MIT.

Rafael Costa: O que ele muda versus as alternativas? Você não troca de app para trocar de provedor — os modelos ficam no mesmo chat. E o MIT significa que a comunidade pode auditar e modificar. É a versão leve do problema que o Liquid Inference resolve na API: multi-provedor sem atrito, mas na sua mesa de trabalho.

Sofia Almeida: E a ferramenta mais provocadora do dia, na minha opinião: o Off the Record. Um app para macOS que altera a sua voz em tempo real para bloquear transcrição por IA — os notetakers e copilotos que entram nas suas reuniões. Processamento 100% local.

Rafael Costa: Isso é interessante porque é a primeira ferramenta que eu vejo atacar o problema de defesa, não de produtividade. As pessoas entraram em reuniões sem saber que um notetaker de IA estava transcrevendo. O Off the Record devolve um controle: sua voz vira algo que o modelo de transcrição não entende, mas o humano do outro lado ouve normal.

Sofia Almeida: Limitações honestas: se funciona bem, também pode ser usado para evadir transcrições legítimas e consentidas. E 100% local é a afirmação do criador — é o tipo de coisa que vale auditar, e sendo questão de confiança, a verificação independente importa muito.

Rafael Costa: E se você quer controle na outra ponta — ser o dono da infraestrutura — dois produtos self-hosted. O Tide é uma alternativa ao Jitsi e Zoom escrita em Go: a mídia fica no seu servidor, tem gravação server-side, login OIDC, e é open source.

Sofia Almeida: O diferencial em uma frase: quando você liga por videoconferência no Zoom ou Jitsi na nuvem, o áudio e vídeo passam por servidores de terceiros. No Tide, ficam no seu. Para quem tem restrições de compliance, isso é o argumento inteiro.

Rafael Costa: E o Tunnl.gg resolve um problema irmão: expor seu localhost para fora. Via SSH, com URL estável — a chave SSH é a sua identidade — sem instalação, com HTTPS e log ao vivo. O servidor é open source, MIT.

Sofia Almeida: O detalhe da chave SSH como identidade é elegante: sem cadastro, sem senha, a chave que você já tem é quem você é. E o log ao vivo significa que você vê o que está sendo acessado na hora.

Rafael Costa: Fechando o bloco de ferramentas de desktop, o Udon é um painel de controle para Mac home server em Apple Silicon: contêineres, storage, terminal e um assistente de IA no mesmo lugar. Vinte e nove dólares vitalício, com cinco dias de teste. E o Markdoc é um editor de Markdown colaborativo, com fonte e preview lado a lado, comentários, sugestões, e publicação direta para gist ou repositório do GitHub.

Sofia Almeida: O Udon cobre a lacuna de quem montou um Mac de cabeceira como servidor e gerenciava tudo via terminal solto. O Markdoc é a ponte entre o editor local e a publicação no GitHub, com camada de revisão colaborativa no meio.

Rafael Costa: E agora, um bloco de nichos — produtos que atacam um problema bem específico de um público bem definido.

Sofia Almeida: O primeiro: OpenSEO. Uma alternativa open source ao Semrush, com MCP para agentes de IA, usando dados da DataForSEO, cobrindo tanto SEO quanto AEO — otimização para motores de resposta, a nova camada de busca.

Rafael Costa: O número que aparece: 22,7 mil estrelas no GitHub. E aqui vale a nossa regra: estrelas medem atenção, não qualidade. O que as estrelas realmente provam é que houve um interesse comunitário grande — e num projeto open source, isso costuma significar olhos a mais no código e uma comunidade ativa. Mas não é prova de que o produto funciona melhor que o Semrush.

Sofia Almeida: A tese, porém, é forte: as ferramentas de SEO tradicionais foram desenhadas para humanos clicando em dashboards. Se o consumidor do dado agora é um agente de IA, a interface certa é um protocolo — e MCP é exatamente isso. Em vez do agente pedir para você colar um relatório, ele consulta os dados direto.

Rafael Costa: O segundo nicho é suporte. O Judged.systems é uma API de julgamento: o ticket de suporte entra, e sai como uma escolha com probabilidades — você pode pedir um score ou uma probabilidade — e limiares que você define decidem se o sistema aceita a resolução ou manda para revisão humana.

Sofia Almeida: É o mesmo padrão de decisão do pmtui e do Polylain — ops, do Polylane: máquina resolve o que está abaixo do limiar, humano revisa o que está acima. O que muda aqui é que é um serviço puro, sem interface, desenhado para embutir em qualquer sistema de suporte. A pergunta em aberto é a calibração: de onde vêm essas probabilidades e quão confiáveis são num domínio específico de suporte? Isso o cliente precisa medir por conta própria.

Rafael Costa: Terceiro nicho, gestão de engenharia: o Leanback é um assistente de IA no Slack para gestores de engenharia. Check-ins diários, ele lê tickets e calendários, e produz um plano de ações. Trinta dias de teste.

Sofia Almeida: O problema é real e pouco atendido: gestores gastam horas sincronizando o que está nos tickets com o que está no calendário. A ressalva: um assistente que lê tickets e calendários tem acesso a informações sensíveis de equipe — como ele resume e o que ele expõe no Slack importa.

Rafael Costa: E o quarto nicho é criação musical: o Tonefold é um compositor de música IA, open source sob GPL, que gera MIDI editável por camadas, via Claude ou Ollama. Exporta MIDI, WAV e stems, e tem um modo produtor com aprovação.

Sofia Almeida: O que o diferencia de geradores de música típicos é exatamente "MIDI editável por camadas". Você não recebe um WAV pronto e imutável; recebe as partes separadas que pode editar. E o modo produtor com aprovação mantém o humano decidindo o que entra. Rodar via Ollama significa que dá para fazer local. E a GPL garante que o projeto permaneça aberto.

Rafael Costa: E agora chegamos no bloco que me deixa mais desconfortável e fascinado ao mesmo tempo: quão real a IA consegue parecer.

Sofia Almeida: O Griffin, da Tavus, é apresentado como o primeiro modelo de interação humana duplex vídeo-a-vídeo. Ou seja, videochamada com uma IA onde você fala e é interrompido, e ela reage em tempo real, com vídeo — não é um avatar com voz em cima.

Rafael Costa: E o número que carrega todo o peso: em testes, 48% dos participantes acharam que era uma pessoa real. Praticamente uma moeda. Agora, a nossa leitura crítica: isso é dado da própria empresa, e "participantes" não diz muito sobre o contexto do teste — quanto tempo duraram as interações, o que os participantes sabiam, como foram instruídos. Então trate como afirmação, não como resultado verificado.

Sofia Almeida: Mesmo assim, se confirmar ao menos a direção, a implicação é grande: voz realista a gente já tem; vídeo duplex realista em tempo real é um degrau novo. Está em preview para testadores — ou seja, ainda não é aberto.

Rafael Costa: E o contraponto delicioso vem logo depois. Enquanto a IA corre para parecer humana perfeitamente, um produto vai na direção oposta: o Revela transforma o iPhone numa câmera de filme analógica em espírito.

Sofia Almeida: Doze películas para escolher. Sem preview — você não vê a foto na hora. E a revelação leva tempo: de uma hora a dias, dependendo da película. Sete dólares e noventa e neuf — e donte, noventa e nove, pagamento único, sem conta, funciona offline.

Rafael Costa: E o que ele vende é exatamente o que a tecnologia removeu: a espera e a surpresa. Numa semana onde um modelo de vídeo convence metade das pessoas de que é gente, alguém cobra oito dólares para te fazer esperar dois dias para ver uma foto. Essas duas coisas dizem muito sobre onde estamos.

Sofia Almeida: E se a ChikyTutor, um tutor de idiomas por voz com lousa interativa, disponível em mais de setenta idiomas. Eles fizeram uma parceria com a L'école de français para um modelo híbrido de francês — a IA na prática, a escola estruturando. E acabaram de lançar no Android.

Rafael Costa: É um bom exemplo de IA de voz aplicada onde ela realmente ajuda: prática de conversação com correção imediata, que é justamente o que um tutor humano em sessão individual não consegue dar em quantidade. E o modelo híbrido é honesto: a escola não foi substituída, foi complementada.

Sofia Almeida: E fechando os assuntos principais, hardware e o corpo. Os Moonwalkers Dusk são sapatos motorizados que chegam a 7 milhas por hora — uns onze quilômetros por hora — cerca de 40% mais leves que a geração anterior, em três tamanhos.

Rafael Costa: Mil cento e noventa e nove dólares, primeiro lote de duzentos pares, envio em doze de outubro. É um número pequeno de primeira leva, o que é coerente para hardware novo — mas significa que a maioria vai esperar. E fica a pergunta de sempre em sapato motorizado: como isso se comporta em calçada, chuva, escada? O uso real dirá.

Sofia Almeida: E o produto mais sério desse bloco: o Aegis, um app de segurança pessoal. SOS conectado a um serviço de despacho 24 horas por dia, 7 dias por semana, GPS ao vivo, áudio e vídeo, perfil médico, PIN de coação e contatos protetores.

Rafael Costa: O PIN de coação é o detalhe que mostra que pensaram no caso real: se alguém te obriga a desarmar o alarme, você digita um PIN que aparentemente desarma, mas na verdade dispara o alerta silenciosamente. Isso é design para situações de verdade, não para a vitrine.

Sofia Almeida: E o mais leve do dia para o dia a dia no computador: o Paw-Paw, um mascote de desktop gratuito para Mac que reage à sua digitação e aos seus cliques. XP desbloqueia dezenas de mascotes e mais de cem itens, e tem um extra de dois dólares e noventa e nove.

Rafael Costa: É o tipo de coisa que parece frívola até você pensar em quem passa oito horas sozinho diante do código. Um bichinho que comemora quando você digita rápido é companhia barata. O modelo de negócio é transparente: grátis com cosméticos, um item pago.

Sofia Almeida: E para fechar o episódio, algo leve para o fim de semana: o Drunken Penguins.

Rafael Costa: Jogos de cartas de festa direto no navegador. Você cria uma sala com código, manda pros amigos, e ninguém precisa instalar app. Tem votos secretos — o que, em jogo de festa, resolve metade das discussões. O baralho inicial é grátis e os pacotes custam um dólar e cinquenta. E inclui o Omi, para quem conhece o jogo.

Sofia Almeida: Nada de IA, nada de agente, nada de modelo. Só gente e cartas. E acho que é um bom fecho, porque o dia de hoje teve de tudo — modelos competindo por preço, agentes supervisionados do Watch, IA dentro do Docs, uma voz que engana transcritores e um vídeo que quase engana pessoas — e no fim, o que aparece é a mesma tensão: quanta decisão a gente delega, e quanta a gente fica.

Rafael Costa: Exatamente. Em quase todo produto de hoje tem um humano no loop em algum lugar — o autopiloto que escala, o PR que espera revisão, o PIN que mente para proteger. A pergunta de cada um é onde colocar esse ponto. Por hoje é isso. Obrigado por ouvir, e até amanhã com mais lançamentos.

Sofia Almeida: Até a próxima!