0804 | Qwen3.8-Max与本周AI新工具:编码、隐私与协作

||Download

Show notes

本期盘点过去 24 小时社区热议的十款 AI 新品与事件。开场聚焦 Qwen3.8-Max,这款 2.4 万亿参数混合专家旗舰模型拥有 100 万上下文,并宣布将进行史上最大规模的开源权重发布。随后是 Open Minis,一款在手机本地沙箱运行真实 Linux 环境、可驱动浏览器的免费开源智能体。yapyap 主打本地优先语音会议记录,音频绝不离开设备,一次性买断 69 欧元。Murmell 用文件级锁让团队和多个 AI 代理在同一画布协同编码。AgentSky 支持从 WhatsApp、iMessage、Slack 等渠道按需启动云端长时程代理。claudemon 把等待 Claude Code 干活的时间变成宝可梦式终端游戏。Hand Wave 借助 Meta 智能眼镜把手语转成文本和语音,但能力边界尚待澄清。CoachAI 用设备端摄像头实时数次数、纠正姿势的健身应用。PassiveShorts 全自动生成并发布 AI 无人脸短视频,引发关于平台审核风险的讨论。gesture.live 用网络摄像头隔空演奏电子音乐。

时间轴

  • 00:00:00 开场
  • 00:00:49 Qwen3.8-Max:百万上下文旗舰模型亮相
  • 00:01:58 Open Minis:手机端免费开源 AI 智能体
  • 00:03:05 yapyap:本地优先的会议记录工具
  • 00:04:14 Murmell:团队与 AI 代理共享编码画布
  • 00:05:34 AgentSky:多渠道长时程云端代理
  • 00:08:16 claudemon:把等待时间变成宝可梦游戏
  • 00:10:15 Hand Wave:智能眼镜把手语转成语音
  • 00:12:14 CoachAI:口袋里的健身教练
  • 00:14:32 PassiveShorts:AI 无人脸短视频自动发布
  • 00:16:21 gesture.live:摄像头手势演奏电子音乐

相关信息

本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so

Transcript

茉莉: 大家好,欢迎收听 Bri 的 Product Hunt 产品分享,我是茉莉。

白桦: 我是白桦。这期有不少值得聊的新产品,从最完整的开源模型,到手语变语音的智能眼镜,还有几个挺好玩的 AI 小工具。

茉莉: 对,我们准备聊聊 Qwen 官方号称迄今最强的新模型,也会看看 Product Hunt 上被热议的一批新品——比如一款免费开源的手机端 AI 助手、本地优先的语音会议记录工具,还有共享云端画布的协作平台。

白桦: 另外还有几款有意思的,像把手语转成语音的眼镜应用、用摄像头数动作的健身教练,以及一个把等待 AI 工作变成游戏的终端插件。内容不少,咱们慢慢聊。

茉莉: 先说说 Qwen3.8-Max。官方称这是迄今最强的模型,主要冲着编码和协作任务来的。它是个超大规模的混合专家模型,参数总量 2.4 万亿,每次实际激活的只有 95B,上下文窗口达到了惊人的 100 万 token,还带多模态智能体能力。 官方披露了一项测试,模型连续运行了 16 天,从一个空仓库出发自己搭建编码测试框架,然后随着新问题、反馈和测试结果不断迭代,最后仓库积累了 265 个提交、127 个拉取请求和 151 个问题。

白桦: 这个自举式的长时程测试很有意思。更关键的是开放策略——API 已经在 QwenCloud 上线了,而开放权重预计下周发布,官方称这会是 Qwen 历史上最大规模的一次开源权重发布。社区里已经有用户惊叹,说能在这种规模下持续开源相当疯狂,因为多数实验室都把模型关在 API 后面,而 Qwen 选择直接在 GitHub 放出完整权重,被视为给社区的一份礼物。

茉莉: 接着看过去 24 小时讨论很热闹的 Open Minis,一款免费开源的手机端 AI 智能体,iOS 和 Android 都支持。它的核心做法是给模型一个真实可操作的计算机,而不只是聊天界面:在设备本地运行一个沙箱化的 Alpine Linux 环境,能装软件包、跑 Python、编辑真实文件,还能驱动浏览器。

白桦: 技术上 iOS 走 ARM64 版的 iSH,Android 用 PRoot,还有 30 多个原生桥接,把健康、HomeKit、日历、照片这些苹果框架暴露成普通命令行工具,开发者说模型操作它们就像调用 ls 一样。用户可以自带模型,Claude、GPT、Gemini、Kimi、Grok、DeepSeek 这些都行。开发者的三大原则是:本地优先,密钥和数据留在设备上、没有账户也没有遥测;自带模型;两边平台全部开源、免费无内购。社区讨论里不少人肯定本地真实环境的方向,但也追问健康、照片、HomeKit 这些敏感区域在权限和审批上怎么处理。

茉莉: yapyap 主打本地优先的语音和会议记录,核心主张是重新拥有你的声音。录制、转录、说话人识别,还有摘要、行动项这些 AI 分析,全部在你自己的设备上完成,不依赖云、不需要账号、没有会议机器人进通话,音频根本不会离开设备。作者特别强调,不是传输中加密,也不是不用你的数据训练,而是它根本不会去任何地方。

白桦: 价格上是一次性买断 69 欧元,给 7 天免费试用,不用绑银行卡,支持 macOS、Windows、Linux,还有个手机伴侣麦克风应用,通过本地 Wi-Fi 同步,不经过互联网。它有个镜头机制,一次录音能生成多种视图,内置转录、摘要、行动项,用户还能用自定义提示词创作更多镜头,比如站会纪要、采访引语、决策日志。支持 90 多种语言。路线图上录制转录、说话人识别、档案搜索、镜头市场、伴侣应用都已经就绪,自带 AI 正在验证,随处导出还在构建中。

茉莉: 最后是 Murmell,一个共享云端画布,让团队和 AI 代理在浏览器里、同一个仓库里一起工作,带实时预览。作者的灵感来自一次 3 个人、4 个代理、1 台笔记本的黑客马拉松,他自己大部分用 Claude Code 构建,后来开始用 Murmell 来构建 Murmell。 现在能同时跑 Claude Code、Codex、Kimi、OpenCode,所有工作会落回 git。

白桦: 核心机制很特别:代理在写入前先申请文件,每个文件路径同一时间只有一个持有者,其他代理会被拒绝直到释放,所以最终不需要合并。合上笔记本,云端机器上的代理继续跑。不过社区讨论也点出了隐患:文件级申请挡不住两个代理各改调用方和接收方,导致构建崩掉;代理死了文件锁变成静默的陈旧锁;更隐蔽的风险是两个代理各自完成同一个任务却毫无冲突,比如两个人同时回复同一个客户,客户收到两份不同答复。发布优惠是首周免费送 60 美元 Claude Code 积分,观看不需要账号,发链接就能看到光标、姓名和实时终端输出。

茉莉: 先说这款叫 AgentSky 的新品,是过去二十四小时在 Product Hunt 上很受关注的一个热门。官方定位就是:任意 harness、任意大模型,云端托管的 agent 按需启动。翻译一下就是,它提供托管式的 agent 即服务,你一键就能启动一个可以长期运行的 AI 代理。它目前支持四种 harness,像是 Claude Code、Codex、Hermes 和 OpenClaw,而且带有完整历史和托管式恢复,也就是代理挂了也能靠着记录恢复。访问渠道很全,WhatsApp、iMessage、Telegram、Slack、网页、开发者 API 和命令行都能用,官方还宣称同一套协议和记忆贯穿每一个 harness、每一个渠道,对 harness 和模型都没有锁定。

白桦: 创建者据社区评论里说叫 Darren,他提到这个想法来自做 tycoon.us 时候的经验,现在已经为 tycoon.us 在生产环境处理了超过一万次的 agent 会话。定价方面,停放中的 agent 免费,只有真正干活的时候才计费,起步价每个月三美元。不过当天还有个新信号值得提:Kimi 的 K3 上线了,那是 Moonshot 的百万上下文旗舰模型,可以直接用在 Claude Code、Hermes 这些 harness 上,页面还列出了像 GPT 5.6、Sol、GLM 5.2、Opus 4.8、Gemini 3 Pro 这些模型。

茉莉: 但社区讨论里主要还有一些待确认的点。比如多个频道上的上下文是不是统一的——在 Telegram 上开聊、再在 Slack 上接着聊,这算同一个会话还是两个会话?同一个 agent 能不能按任务切换便宜或者更强的模型?开发者 API 和命令行之间到底有什么区别,能不能编程式地创建、暂停、恢复和管理 agent?失败的任务能不能从之前的状态恢复、能不能回滚到更早的快照?还有多用户同时交互的时候,能不能自动扩容,运行中间收到消息是打断还是排队。

白桦: 另外有转述说,Darren 本人也承认状态恢复是尽力而为的,没法完全阻止竞态条件,他还提到想要幂等的回复。也有人质疑,在这种只在工作时收费的模式下,崩溃的、暂停的和正常完成的 agent,在账单上其实是区分不出来的。所以几个值得盯的点是:多频道记忆到底统不统一,任务级切换模型顺不顺畅,还有状态恢复到底靠不靠谱。

茉莉: 接下来这款叫 claudemon,一个把等待 Claude Code 干活的时间,变成宝可梦式游戏的终端插件。产品页的描述就很直白:野生宝可梦会在你使用 Claude Code 工作的时候出现。核心机制是,提示词相当于你在草丛里走路的步数,提示词越长就走得越远,而 Claude 每工作二十秒,你就多走一步。有宝可梦跳出来的时候,Claude 的状态栏会提醒你,然后你得在第二个终端标签页里开战。

白桦: 有个很讲究的设计:游戏只会在 Claude 工作期间推进,而不是你按回车那一瞬间,所以它瞄准的就是那种"没时间切走、又长到只能干等"的空档。出现机制是每次只来一只、只停留半分钟,你要是在忙它就会走掉,不会累积战斗队列。内容包含全部一百五十一只初代宝可梦,带真实的基础数值、属性、捕获率和红蓝版招式,还有会心一击、属性克制这些机制,捕捉、进化、图鉴、队伍和商店都做了。

茉莉: 它完全本地运行,没有账号也没有后端,唯一联网下载的就是大约一点二兆的精灵图。开源项目,MIT 许可,作者叫 zamarrowski,页面上也注明宝可梦是任天堂、Creatures 和 GAME FREAK 的商标,这是个个人非商业的玩具。需要的环境是 Node.js 18 以上和 truecolor 终端。

白桦: 社区里有人评论说,第二个终端标签的角度挺怪的、但居然管用,也有人建议把遇敌和退出做成绑定代码而不是经过的时间。还有用户问会不会影响等待时间,材料里没见到回复。整体上是个挺有意思的等待空档玩法,短板自然就是那半分钟的窗口和只限一次性单只出现。

茉莉: 下一个焦点是 Hand Wave,一副把手语转成语音的智能眼镜应用。它的核心就是利用 Meta 智能眼镜自带的摄像头,把手语转成文本和语音,同时支持 iOS 和网页跨平台使用。底层是一个轻量级、开源、基于 Google FSBoard 数据集训练的神经网络,设计目标是在各类设备上本地运行,目前标注为 WIP,也就是还在开发中。产品由 Aadi Sanghvi 设计并构建,官网是 handwave 点 sh。

白桦: 开发者给自己的定位是,用 Meta 眼镜和其他设备上已有的摄像头,让手语对话更容易获得。社区反馈也基本围绕本地运行模型来展开。有评论说这一做法真正酷,能压低延迟、还能让隐私故事保持干净,也称赞开源的手语工作能真正落到眼镜上。另一条评论强调,无障碍工具绝不应该依赖付费墙或者网络连接,所以这种开源、本地优先的模式受到肯定。

茉莉: 不过有位评论者提出了一个很关键的疑问:如果没记错,FSBoard 是手指拼写的数据集,覆盖的是单个字母而不是完整的手语。那 Hand Wave 到底是只逐字母读取手指拼写的单词,还是也能处理真正的 ASL 手语和语法?他觉得这是两个差别很大的问题,而把手语变成语音这个说法,听起来像是在承诺后者。目前公开讨论里,还没见到开发者对这个边界做出明确回应。

白桦: 产品页面的状态也显示当前没有直播会话,只提供启动摄像头或者屏幕共享的控制,说明产品还处在演示或早期阶段。所以接下来值得关注的信号就是:开发者会不会澄清手指拼写和完整手语之间的能力范围,以及 Hand Wave 到底什么时候正式上线。

茉莉: 最后这款叫 CoachAI,一个面向 iPhone 的健身应用,支持 iOS 17 以上,可以免费开始使用。主打用手机摄像头实时数动作次数、纠正姿势,而且所有识别都在设备端完成,不会上传任何数据。应用里还带一个训练程序引擎,会根据情况适当调整训练安排,而不是随机打乱动作。

白桦: 开发者自述,做这个产品是因为他常看到一种现象:人们坚持去健身房、练得很刻苦,却还是受伤或者陷入平台期。问题不在缺少自律,而是没人盯着他们的动作。私教太贵、时间又难配合,大多数人只能靠猜。他提出的核心问题是——手机能不能看出一个动作做错了?他的答案是可以。

茉莉: 在产品流程设计上,他也有个明显的转变。最初的引导要求先填目标、身高、体重、伤病这些,要填五个屏幕,结果流失了不少人;后来他把顺序完全反过来,先让用户做一次被跟踪的动作,再提问,用他的话说是先展示魔法、再填表格。他还说,一个没人用过的精致应用只是一个非常昂贵的意见,所以宁可提前带着粗糙细节发布,也要拿到真实反馈。

白桦: 发布状态上,他承认产品还很早期、有些地方粗糙,特别希望在跟踪准确度上得到严厉批评。社区里有人尊重这一点,但也提出关键技术担忧:手机被支在侧面的时候,深蹲、硬拉这类大重量复合动作的下蹲深度、或者脊柱圆背可能拍不到;如果角度不佳却仍然给出动作正确的评价,那可能比没有反馈更糟,因为人们会信任它并继续加重重量。所以评论者就追问,应用有没有机制提示当前角度不足以判断这个动作?

茉莉: 另一位用户则问能不能用于其他运动,比如分析网球挥拍并实时反馈,还提到设置可能棘手,但可以戴 AirPods 听反馈。产品已经提供 App Store 链接。后续值得关注的信号包括跟踪准确度的实测反馈、对角度不足提示机制的回应,以及它有没有扩展到网球等其他运动方向。

茉莉: 这轮先说 PassiveShorts,一款在 Product Hunt 上架的 AI 无人脸短视频生成器,制作者叫 Vijayabhaskar J。它的卖点是把一整条完整的流程全替你包了——选主题、写稿、配音、逐行配图、加字幕,甚至定时发布,统统自动做完,然后直接发到 YouTube 和 TikTok。

白桦: 它内置五个赛道:恐怖故事、笑话、生活小技巧、今日新知,还有 You Should Know 这类冷知识,当然你也可以自己定主题。视觉风格给了 19 种,从写实摄影、电影感、动漫,一直到 Kurzgesagt 那种科普动画和黏土动画都有,还配了自然的 AI 语音库和六套字幕预设。

茉莉: 内容分成解说视频和照片幻灯片两类,幻灯片既可以自己传图,也可以按提示词让 AI 生成。发布上给了不少控制:可以选择公开、私密,或者先发进 TikTok 的草稿箱留着自己审。最多能同时跑十个系列,视频带完整商业使用权。价格上,Basic 每月 19 美元,一周三次、一个月十二个视频;Pro 每月 39 美元,天天都能发,一个月够三十一个视频,年付能免两个月,还有七天退款保证。

白桦: 不过社区讨论的焦点不在功能,而是它全程无人审核就自动发布。有人担心,刚好赶上 YouTube 和 TikTok 今年都在收紧对批量低质 AI 内容的打击,全自动发布很容易让频道被标记。还有人举例说,错误脚本会在没人核验的情况下以用户频道名义发出去,所以建议前十个视频先默认留审,确认没问题再放开。

茉莉: 再来说 gesture.live,最近社区里讨论度很高的一个新品。它用网络摄像头捕捉你的手势,让你隔空现场演奏电子音乐,能弹和弦、贝斯、鼓,还有各种效果器。目前是 v1.0 版本,需要横屏用,两只手共用同一个 16 比 9 的画面,控制轨横跨整个屏幕。

白桦: 开发者说,这个东西借鉴了几周前在 Instagram 上走红的一个名为 gesture-synth 的手势合成器,沿用同一套和弦语言,但压缩到单手操作,另一只手就能空出来自由弹旋律、加鼓和贝斯模式,或者控制效果。

茉莉: 社区里其实有未经证实的疑问。演示视频在明亮房间的书桌前效果很好,但换成小型舞台或者家庭派对的舞台灯光、更暗或多彩的灯光下,手部追踪还能不能稳住,被视为它能不能走出卧室制作人场景的真正考验。

白桦: 另一条比较专业的评论指出,关键问题在音符触发有没有量化。网络摄像头的手部追踪通常最好也就三十帧每秒,音频线程收到信号前就有大概三十毫秒的抖动。如果吸附到十六分音符的网格上,倒是能弹,可会丢掉那种推前拖后的演奏感,而那恰恰是人声演奏感的核心。当然也有非音乐用户说自己大概只会拿来和孩子玩,但觉得它看起来很棒。

茉莉: 好,聊到这,今天的热榜可真够热闹的。从 Qwen 官方号称迄今最强的 Qwen3.8 模型,到一堆在 Product Hunt 上冒出来的新玩法——手机上的开源 AI 助手、抢你声音的语音记录器、连手语都能解读的智能眼镜,还有一个把等待编码变成抓宝可梦的终端小游戏。

白桦: 没错,看得出来 AI 正在往越来越具体、越来越贴近日常的方向走。无论是让你在画布上和 AI 代理一起协作,还是用摄像头实时纠正健身动作,每一款都在试着解决一个真正的问题。

茉莉: 好,那这期就聊到这了,我们下期再见!

白桦: 下期见!