
0807 | OpenAI升级ChatGPT、AMD收购Taalas、Qwen3.8 Max争议、GitHub服务降级
Show notes
本期节目梳理了多则科技与开发者圈的热点。开场是 OpenAI 升级 GPT-5.6 Sol、向免费用户开放 Luna,HN 对示例与参与度调校看法分裂;随后是 AMD 收购 Taalas,把模型权重直接蚀刻进硅片以加速推理,以及 Qwen3.8 Max 登顶 Agentic 指数但基准口径备受质疑。接着是 GitHub Actions 与 Pages 再度降级引发吐槽。日常话题方面,开发者吐槽晨跑被手机误判为抢手机,引出防盗检测的讨论;数据游戏显示人类审批者会漏掉三分之一的 AI 代理威胁;尼泊尔政府接入 Have I Been Pwned 成为第四十七个政府。游戏与硬件方面,Quake 三十周年更新、Herdr 加入 YC 保持开源、ProvenMetal 尝试让美国电路板数天交付、Channels SDK 把代理带进 Slack 与 Teams,以及耗时两年的 Altar II 机械键盘(可惜没有 Touch ID)都各有看点。最后两篇引发深思:日本宜居城市的“礼貌”规则是否真的简单,以及软件制作中“品味是最后剩下的东西”的讨论。
时间轴
- 00:00:00 开场
- 00:00:35 OpenAI 升级 GPT-5.6 Sol,免费用户解锁 Luna
- 00:03:35 AMD 收购 Taalas:把 AI 模型刻进硅片
- 00:07:30 Qwen3.8 Max 登顶 Agentic 指数,但基准之争未休
- 00:09:56 GitHub Actions 与 Pages 再度降级
- 00:12:08 晨跑被误判为抢手机:防盗检测该不该做?
- 00:13:48 四万次试玩:人类漏掉三分之一的 AI 代理威胁
- 00:16:01 尼泊尔政府接入 Have I Been Pwned
- 00:17:44 Quake 三十周年更新与开源移植适配
- 00:19:24 Herdr 加入 YC,运行时保持开源
- 00:21:52 ProvenMetal 让美国电路板数天交付
- 00:24:29 Channels SDK:把代理带入 Slack 与 Teams
- 00:26:49 耗时两年的 Altar II 机械 Magic Keyboard
- 00:29:09 日本最宜居城市的“简单”规则真的简单吗
- 00:31:33 品味是最后剩下的东西:软件里的手艺与市场
相关信息
- Improving GPT‑5.6 Sol in ChatGPT, expanding GPT‑5.6 Luna access for free users - Bri Hacker News Campaign Feed
- AMD acquires Taalas to boost inference performance by etching models in silicon - Bri Hacker News Campaign Feed
- Qwen3.8 Max now ranked as the best overall model by agentic index - Bri Hacker News Campaign Feed
- GitHub Actions and Pages are experiencing degraded availability - Bri Hacker News Campaign Feed
- My phone detects going on a run as “someone snatching my phone and running off” - Bri Hacker News Campaign Feed
- Humans missed 1 in 3 threats approving AI agent commands across 40k game runs - Bri Hacker News Campaign Feed
- Welcoming the Nepalese Government to Have I Been Pwned - Bri Hacker News Campaign Feed
- Quake – 30th Anniversary Update - Bri Hacker News Campaign Feed
- Herdr is joining Y Combinator. The runtime stays open - Bri Hacker News Campaign Feed
- Launch HN: ProvenMetal (YC S26) delivers circuit boards in days instead of weeks - Bri Hacker News Campaign Feed
- Show HN: The Channels SDK – Bring Any Agent to Any Channel (Slack, MS Teams) - Bri Hacker News Campaign Feed
- Show HN: I spent 2 years designing a mechanical Magic Keyboard - Bri Hacker News Campaign Feed
- Four simple rules behind Japan's most liveable cities - Bri Hacker News Campaign Feed
- Taste Is All That's Left - Bri Hacker News Campaign Feed
本期节目由 Bri 出品。Bri 使用先进的 AI 技术将你在意的资讯转换成适合收听的播客。如需联系,请发邮件至 hi@bri.so。
Transcript
林岚: 大家好,欢迎收听 Bri 的《HackerNews每日沙龙》,我是林岚。
陈序: 我是陈序。今天这期,我们先聊聊 OpenAI 对 GPT-5.6 的升级,还有 AMD 收购一家 AI 芯片初创公司的消息;之后会带大家看看 Quake 三十周年的新章节,以及一个让你扮演 AI 审批人的小游戏带来的有趣数据。
林岚: 另外还有关于 GitHub 服务短暂降级、日本城市的宜居秘诀,以及一份关于 AI 编程体验的深度思考。我们这就开始。
林岚: OpenAI今天宣布改进了ChatGPT里的GPT-5.6 Sol,同时把GPT-5.6 Luna的访问扩大到免费用户。官方说,Plus和Pro用户用到的Sol会给出更专注的答案、更可靠的事实和更一致的输出,还加了一个新的滑块,可以控制每次回复的思考量。免费用户这边,默认模型升级成了Luna,可以用无限量的文本聊天,另外多了一个Think按钮,专门处理更难的推理问题。官方还提到,同一个模型现在同时驱动即时回复和深度推理,每周有十亿人使用ChatGPT。公告里举了个天气问答的例子,说新的Sol会直接回答是的、你应该保持干燥,而旧版模型会给出一个更长的分项说明。Hacker News上的讨论对这次更新看法比较分裂。有人觉得那个示例很奇怪,说人类通常会直接讲这里夏天不下雨,即使模型已经识别出降雨概率是零,还是会把对话拖长。还有人认为模型明显是为了让用户停留更久、参与更多而调校的,不是按效率优化,并质疑这种靠参与度刺激的玩法能持续多久。也有评论说,GPT模型被反馈调校得不会直接给答案,从GPT-4o那次开始每次发布都这样,需要彻底推倒重来。不过对免费计划,不少人是认可的。有人说免费无限量用Luna是相当厉害的一步,也有人指出大多数人其实没试过最先进的模型,平时用的还是旧版或者谷歌搜索的那些AI概览。关于有没有上限,有人回顾了免费额度的变化,曾经是每五小时能发十条特定消息,后来变成无限量的轻量版,最近又一度降到每天大约五条,再后来又改成无限量的另一种版本。模型评价上,有付费用户说Luna用来写代码性价比不错,但不是特别信任它处理复杂任务,自己经常还是用另一个工具。也有人反驳说那个工具又差又不够便宜,建议用Luna或者Sol。还有人觉得Luna刚出来时体验一般,另一家的模型懂得更多,打算再试试。更宏观地看,有评论认为OpenAI正在感受到商品化的压力,ChatGPT和克劳德这些产品还是好产品,但已经不再是高端定位。他预计接下来一年会出现独家工具服务协议和API集成,营销会大幅转向企业客户,API按量收费越来越明确,而聊天界面越来越免费,同时美国可能限制非美国托管的模型进入政府相关的企业合同,行业底部的价格正在被压向免费。下一代模型也许能恢复那种光环地位,但这会打乱IPO的计划。另外还有个有意思的观察,说Sol很费token的抱怨在某个专门追踪代码工具资源重置的网站上催生了新的数据点,但官方发布里那个天气图形让他觉得,节省token并不是这次更新的目标。
陈序: 接下来看AMD的一笔收购。根据报道,AMD在本周四收盘后宣布收购AI芯片初创公司Taalas,交易条款没有披露,报道称据他们了解这是一起真正的收购,不是那种收编团队式的收购。这笔交易被放在一个类似的语境下:去年十二月Nvidia曾花两百亿美元授权Groq的技术,目的都是让面向AI代理、比如代码助手的高性能推理服务跑得更快、更便宜。AMD的AI高级副总裁在声明里说,AMD正在构建全栈AI平台,让客户能够灵活地为每个AI工作负载部署合适的计算方案。Taalas这家公司2023年在多伦多成立,它的做法很特别:把模型权重直接刻进硅片里,不依赖高频内存,报道称之为模型专用集成电路。今年二月它公布了在台积电6纳米工艺上流片的首个测试芯片,叫HC1,能在一秒内处理一万六千九百六十个token来运行Meta的开源模型,报道说发布时这比Nvidia的GPU快48倍,比另一家加速器厂商快8.5倍。不过要注意,它跑的那个模型是2024年年中的老模型,这块掩膜版尺寸的芯片主要用于验证概念。芯片分成两大区域:一块是蚀刻了权重的掩膜部分,负责存储模型参数;另一块存KV缓存和微调用的适配器。第二代芯片计划今年夏天推出,目标把参数量提高到200亿。每个芯片200亿参数意味着,50个加速器就能支撑起一个万亿参数的模型,而且比Nvidia新公布的一套需要几十个GPU、至少两千个专用加速单元的系统更省空间、更省电。报道称,据他们了解,AMD打算把基于Instinct的机架和Taalas芯片搭配使用,形成一种分工架构:GPU处理计算密集的提示输入,Taalas加速器负责生成token。AMD也可能采用一种交替节奏,让客户先在Instinct上验证模型再迁移过来,不过这只是猜测。明显的缺点是,芯片一旦部署,就被那一版模型锁死了,任何比小型适配器更大的改动都会带来麻烦。Hacker News上对这个消息的反应挺复杂的。有人说本来盼着有一天能看到Taalas的硬件真正上市,有人说他们甚至没得到发布硬件的机会就没了。还有人感慨梦想破灭,调侃说再过一二十年可以在二手市场上花不到五千美元淘到退役的企业级产品。也有人反问,到底什么在阻止竞争。关于这个设计思路本身,有人认为它有自限性,但方法不错,不需要全新的架构或无限的显存就能明显提升性能。有人反驳说,这就是新架构,是非冯·诺依曼的设备。有人贴出了演示链接,说这东西快得惊人。不过也有人提到,演示模型不相信自己跑在那块芯片上,还跟他争辩。有人解释,那模型目前跑的只是个很小的非推理模型,而且几乎所有的语言模型都会就自己运行的硬件或模型给出争辩性的回答。还有人补充说,AI并不天然了解自己,经常答错这类问题,可以通过系统提示词修复,但有人可能觉得这是浪费token,因为大多数使用场景根本用不到这个信息。
林岚: 接下来聊聊模型评测。有一份Agentic风格的指数把Qwen3.8 Max列为最佳整体模型,但Hacker News上的讨论普遍指出,这个结论非常取决于你用的是哪项基准。有评论质疑,某个专门评测编码代理的页面通篇没有提Qwen,怎么又在一个指数里被列为最好。有人澄清,这两类指数不是一回事:那份Agentic Index是把两项评测的加权平均,而另一份专门的编码代理指数包含另外三项。Qwen3.8 Max在Agentic Index上得了55.4分,但根本没参加那份编码代理指数的测试。还有人说,编码代理其实应该看成模型加外部工具的组合,那份专门页面收录的模型要少得多。有人补充说,其实不是所有基准都跑了,它所谓的最佳仅限于那一份指数,编码方面有几项关键的测试是缺失的,其中一项的得分明显低于另一款模型。成本对比也很有意思。有人引用图里的数据:有的模型每个任务只花约五分美元、指数52,有的每个任务三毛六、指数56,而Qwen每个任务要一块一毛三、指数58,另一款更贵的要一块八、指数63。据此有人认为,某款竞品看起来最有性价比。个人体验方面,有人对某款较小的Qwen模型很兴奋,说它在特定芯片上处理提示输入较慢,但做Agentic任务表现很好。他个人配了本地工具在用,已经取代了谷歌搜索,自己写代码用另一款工具,正考虑换成别家的,而且觉得它的水平相当于某款较旧的Sonnet。有人追问那些Agentic任务到底有多复杂。也有人对Artificial Analysis这个名字本身存疑,但对更大的Qwen模型印象不错,也试过Kimi,觉得也不错,不过深入使用时还是能感觉到质量下降。他评价说,他们在一算力换质量的权衡上做得极好,本地部署的能力不可替代,还猜想如果没有中国的竞争,可能就不会有后来的开源模型。补充一下背景:这份指数把包括这几项评测在内的九项基准纳入计算,几百个模型里只有二十六个在列,而更新日志显示,Qwen3.8 Max的评测是本月五号新加入的,所以这个最佳其实更多是一个特定口径下的结果。
陈序: 最后是GitHub那边的一个故障通报。GitHub的状态页显示,8月6日,它的自动化构建服务Actions和网页托管服务Pages都出现了可用性降级。按官方时间线梳理一下:一开始在调查影响Actions的错误,部分工作流运行无法启动或者中途失败,部分API请求报错。中间Pages一度恢复正常,但随后又再次性能下降,同时Actions的问题还在继续,部分工作流运行延迟或无法完成,部分API请求报错,用企业迁移工具的迁移也可能失败。到后来状态更新为Actions和Pages都在降级,工程师已经应用了多项缓解措施,并在继续推出进一步修复。Hacker News上的反应相当犀利。有人说这是8月份第6起事故,而且就发生在8月6日,觉得这个模式不祥。有人回应说,其中四起其实都涉及AI工具相关的问题,所以实际上只是同一个长期持续的事故,以后还是有一半概率会宕机。有人干脆说,非常沮丧,已经没更多可补充了。还有人说,GitHub损害自身声誉的速度令人着迷。也有评论半开玩笑地说,很快GitHub某功能恢复正常反而更有新闻价值了,还指出GitHub归某家大的超大规模云厂商所有,所以把责任推给AI和扩展的借口很无力。有人问微软是不是把做用户实际会用到功能的人都裁了。有人回应说,GitHub已经没有自己的CEO了,所以可以说是;还有人补一句,就算有CEO的时候也很糟糕。还有人讽刺地质问,开发七个不同的AI对话界面和充满bug的网页改动,难道不算对工程时间的良好利用吗?当然也不是全都唱衰,有人表示自己也遇到这些问题,但称赞负责的人很棒。总的来说,这一轮故障再一次把GitHub稳定性的口碑推到了风口浪尖,而关于责任到底该归AI扩张还是运营管理,讨论还在继续。
林岚: 先从一个有点哭笑不得的日常说起。有开发者 Fabian Giesen 在 Mastodon 上吐槽,说他的手机在最近一次更新之后,居然把他一次普通的跑步出行识别成“有人抢走手机逃跑”,然后立刻锁屏,还把他用来配速的跑步应用给踢了出来。这个吐槽被搬到 Hacker News 上,大家就认真地讨论起这种手机防盗检测到底值不值得做。
陈序: 讨论里有个核心分歧是场景有多常见。有人质疑“抢了手机就跑”在有些地区是不是常见到值得专门做一个功能,还是说厂商在追逐一种很少发生的恐慌,结果反而给正常用户添麻烦。支持的评论马上就举例:英国伦敦一年有七万起这类盗窃,巴西甚至因为问题太严重,政府专门做了个官方应用来上报手机被抢,墨西哥那边也比较普遍,经常有人骑着摩托车或踏板车,从路边不注意的行人手里顺走手机。
林岚: 有意思的是,这个讨论还解释了为什么现在有人抢手机,跟以前不一样了。以前手机偷来重置一下还能转卖,但现在转售价值大大下降,所以有人选择在锁屏之前,赶紧去清空手机里可能没重新认证的加密货币钱包或银行账户。
陈序: 相应地,也有用户分享了实用建议,比如在手机上给银行这类敏感应用额外开启人脸识别,这样即使手机被拿在手里,想打开应用也得再刷一次脸。还有人提到,这阵子流行的长斜挎手机挂绳,某种程度上就是专门为了对抗这种抢夺。
林岚: 接下来这个话题挺扎心的。有一款叫 Scale X 的小游戏,专门让你扮演 AI 编程智能体的人类审批者,在时间压力下决定批准还是拒绝智能体提出的命令。作者把游戏上线后的统计数据分享了出来:累计大约四万次游玩,四十万九千次独立的批准或拒绝决定。
陈序: 结果不太乐观。即便游戏开头明确警告了有威胁,普通玩家平均还是会漏掉三分之一的威胁,平均准确率只有百分之六十六出头。有将近三分之一的会话是以负分结束的。虽然有三成五的玩家抓住了所有威胁,但其中真正能把误拦截安全命令控制在五分之一以内的只有大约两成,剩下的人很多是靠“见什么拦什么”拿到的满分称号。还有百分之七的玩家,干脆批准了每一个提示,作者调侃他们是“无条件信任派的粉丝”。
林岚: 更值得注意的是威胁类型之间的漏检差异。明显破坏性的命令,比如删除整个系统这种,漏检率最低,只有一成多。但隐蔽性强的就糟糕得多:往外泄露文件这类操作漏检率有三成多,范围型的不当访问命令也是三成五。最容易被放行的是一类看起来很正常的项目脚本命令,平均六成多都会被玩家批准,因为智能体在日志里显示的只是“运行这个脚本”,玩家根本没意识到脚本内部藏了外传数据的代码。
陈序: 这不只是游戏的问题。评论区有开发者点破了机制上的漏洞:所谓让人类批准某个特定命令,这个模型本身就站不住脚,因为智能体完全可以先偷偷改动项目配置,再让你批准一个看起来很正常的命令。作者也引用语言模型厂商自己的说法,说用户看到的批准越多,对每个批准的关注就越少,监督会逐渐变懒。作者本人的立场是,与其指望人在一环一环地盯,不如把沙箱和权限隔离做得更易用,在隔离没到位之前,不应该把“人在环中”当成可接受的替代方案。
林岚: 换个话题,说说数据泄露监测工具 Have I Been Pwned。它的创始人 Troy Hunt 在八月三号宣布,尼泊尔政府正式接入这项免费服务,成为第四十七个加入的政府。这意味着尼泊尔的国家网络安全中心现在可以对照海量的泄露数据库,监控政府域名、识别政府邮箱账号是否暴露,并且在账号出现在新泄露里时快速响应。
陈序: 评论区说这是实打实的好消息,因为尼泊尔政府 IT 的现状确实堪忧。有用户举例说,护照续签的预约页面居然要求用户手动把本地时区改成亚洲加德满都;也有人提到,一些政府网站的输入没有做基本清洗,可能被用来对生物识别数据运行任意查询,业内甚至有人发现过一个疑似故意不修的漏洞,最可能的用途是助长腐败。
林岚: 政治背景也交代了一下。有评论问这是不是去年旧政府被推翻之后的新政府,有人确认说没错,新政府是今年三月当选的。不过也有提醒声音:有批评者认为这种欢迎的消息标题有点误导人,让人第一反应以为是政府数据被泄露、然后加入了数据库,而不是反过来——用数据库来保护政府。作者和评论者都强调,这恰恰是这项服务的初衷,让国家网络团队在攻击者利用泄露凭证之前就采取措施。
陈序: 后续值得留意的是,尼泊尔那边会不会真的把这些监控能力用起来,尤其是会不会借着这次接入,推动政府在输入清洗、漏洞修复这些基础安全问题上有实际改善。这比接入本身更值得观察。
林岚: 最后聊一个游戏老玩家的回忆杀。经典射击游戏 Quake 迎来三十周年,id Software 和 MachineGames 合作放出了免费的更新章节,叫《Dawn of the Machine》。这一章带了十九张全新地图、全新原声带、隐藏秘密,还有一张新的对战地图。
陈序: 玩法设计上也下了功夫。战役采用了时间循环的结构,每次返回体验都会有变化,符文会解锁不同路径,还有能提升的持久生命值和弹药。武器方面有能连续放闪电的斧子,还有发射弹射弹的激光炮,同时加入了全新敌人类型。更新里还附带了工作室的幕后开发资产、未用内容和早期可玩关卡,另外加了三个新成就和作弊菜单。
林岚: Hacker News 上讨论最热的是兼容性问题。有开发者问开源移植版能不能跑这个新章节,马上就有人指出来,这次更新把本地化文字文件的存放位置改了,所以老的开源移植版在更新前可能无法正确显示文本,而且新章节没有单独下载,得先装官方移植版。但也有人安慰说,之前几个官方章节发布后,主流的开源引擎都很快跟进支持了,所以这次改动要适配过来也不会太慢。
陈序: 另一条比较轻松的讨论线是关于官方公告的文案。有人吐槽文稿里 emoji 用得太密,猜是谁这么爱用,评论区就把锅推给了各种可能——有人说是 Notion 这类工具带起来的潮流,有人说是 LLM 驱动的写作方式。不过这些其实都只是评论者的个人猜测,不代表官方的说明。
林岚: 先看 Herdr 这条消息。它的创始人 Can Celik 在博客里写,四个月前他还在找工作,之后决定一个人独自搭建一个编码代理运行时。现在他宣布加入 Y Combinator 的 F26 批次。他坚持终端是一等公民,代理拥有持久化的面板、标签和项目,可以跑在自己的 VPS 服务器上,还支持一条命令远程自动安装。
林岚: 目前这个项目已经到两万五千星、三十四万下载。插件市场发布一个月,就超过了五百个插件,社区还额外做了 Raycast 扩展、Stream Deck 按钮和 iOS 应用。博客强调运行时保持免费,采用 Apache 二点零许可,最近刚从 AGPL 切换过来,目的就是让所有人都能自由使用。作者计划组建一个小团队,核心保持小巧,其余功能都靠扩展来做。
陈序: HN 上的讨论焦点落在 YC 给开源工具带来的影响。有用户自称是 Herdr 的大粉丝,但担心进了 YC 就意味着风投、商业化,甚至一步步变味,还拿 Warp 从干净的终端项目变成追逐金钱来举例。不过他也强调自己并不反 YC、不反风投,只是有顾虑。
陈序: 有人在评论区说,现在也许是找替代品的时候,一年后再看;也有人回,其实用户自己维护一个 fork 就行。另一派观点认为这是典型的风投剧本:先用补贴或免费产品削弱竞争对手,之后再涨价。反对的人则说,如果团队只是想拿 YC 资金、保持小规模、专注改进产品,YC 合伙人会支持,而且 YC 本身就建议不需要风投就别拿。还有人举出例子,说明有可能提前偿还早期投资人、实现双赢。
陈序: 也有用户问怎么让 YC 选中开源项目,并贴了自 2011 年起自己搭建平台的链接,答案是简单的两个字:流量,也就是 traction。还有 stagex 团队的成员表示,会把 Herdr 作为日常驱动并贡献进 stagex,由多方引导、复现并签名确定性二进制,提供独立于 Herdr 的发布流程,只要没出现企业追踪行为,就从下个月的版本开始原样提供高供应链完整性的版本,必要时会跟着社区主导的 fork 走。
林岚: 再来看电路板这件事。ProvenMetal 的两位创始人发了个 Launch HN,是 YC 夏季批次的项目,标题是数天而不是数周交付电路板。帖子给了个背景:美国在 2000 年生产全球百分之三十的印刷电路板,现在只剩百分之四,而中国厂商约占全球百分之五十五。
陈序: 他们一开始在自己车库用准专业设备手工组装电路板,结果百分之九十的时间都花在装配上,被产能卡住。于是他们转向自己认定的真正瓶颈,也就是报价、可制造性审查和元器件采购这些前台环节。系统会自动从美国和海外分销商匹配物料清单,提供常用设计软件的插件,能在布局定稿前预订长交期零件、建议缺货替代料;零件存放在旧金山总部,再成套配板并路由到制造网络。他们还给每家制造商建立档案来适配各自的订单格式,并用启发式工具检查可制造性问题。
林岚: 两位创始人坦承,软件本身解决不了产能问题,它只是抽取系统里有限的闲置产能。公司按复杂度在订单金额上加简单利润,报价明细透明。里程碑是:六周内约七万美元收入、十一个订单,第一个付费订单不到一周就达成。
陈序: 评论区有不少讨论。有人认为美国国内回流缺乏原材料和供应链支撑,对缺乏经验的团队近乎登月,初期依赖国防业务至少能避开和中国直接比价;作者回应说整个供应链必须跟上,原材料与产能比分销商更重要,先做国防积累能力再降本,但也承认不可能一开始就打败中国。有人问欧盟有没有类似服务,作者说自己不熟欧盟市场,但听说 Eurocircuits 不错。
陈序: 还有用户报了一个很具体的价格对比:欧洲某家厂商三块五乘五厘米的六层板要一百八十四欧元、十三天,而在中国一家知名厂商那里,五块十乘十厘米的六层板只要两美元、十一天。于是有人追问六层板为什么这么贵,是否真的无法接近中国厂商的价格。另外有欧洲厂商的高管来自荐,说高度自动化让价格从十几欧元含税和运费起,软件平台完全自研并集成了行业标准的数据格式。
林岚: 接下来是 CopilotKit 工程师发布的 Channels SDK,这是首次公开发布。仓库定位是把任意代理引入任意聊天平台的开源 SDK,支持 Slack、微软 Teams、Discord 和 Telegram,并带原生可交互界面。它构建在 AG-UI 之上,任何能输出 AG-UI 的代理都能接进 Slack 和 Teams;WhatsApp 目前只在开源侧支持,托管服务的完整支持在路线图上。
陈序: 团队内部已经跑起来一批小任务代理:有一个包装送餐命令行工具处理办公室午餐订单,有一个做事故分诊,还有一个根据 GitHub 合并请求按需生成营销视频。作者说之前热衷于把代理带到网页上,现在越来越相信聊天界面才是实用代理最自然的家园。
林岚: 架构方面,作者解释把各平台当成一层,适配器把各个平台的回调解统一成中性事件;投递、排序和重连都有专门处理,运行循环采用先确认的做法,先发审批卡片、确认送达、点击后再恢复运行,所以审批能在重试和进程重启后存活下来。渲染层是聊天的虚拟 DOM,JSX 编译成各平台原生的卡片格式,按钮标识用内容哈希而不是每次部署重新生成,因此旧按钮在新版本上线后仍然有效。
陈序: 许可协议是讨论的焦点。有用户认为所谓的开源部分只是客户端,真正运行的服务其实是闭源且受许可限制的。作者回应说这不一定是错,这是成熟度的问题,目标是开源部署可用,配合企业版体验更好,用户可以不经托管服务、直接使用开源包里的 Slack 和 Teams 适配器。
林岚: 也有人拿它和 Vercel 的 Chat SDK 对比。作者澄清那不是专有包装,Chat SDK 只是灵感来源,而且漏掉几个难点:生成式界面需要持久,聊天界面天然是多人场景,代理不应像机器人一样刷屏。另一位用户承认 AG-UI 是真实差异,但反驳说 Vercel 那套也有自己的卡片系统,能渲染原生卡片、带按钮和状态后端;他自己就曾试用过那个 SDK,因为不满足需求而弃用,最后自己写了一套实现。
林岚: 最后一个是一个花了两年设计的键盘。作者四年前第一次在 HN 展示键盘,反馈促使他辞职全职做键盘,现在发布了成品。这是一个超薄的全机械键盘,目标是取代苹果的 Magic Keyboard。主要制作障碍是:要在机身里塞进合理尺寸的电池,还要做激进的功耗优化,因为 PCB 底面完全没有空间放元件。
陈序: 价格上,正式定价三百四十九美元,预订价两百四十九美元,省一百美元。它采用钢制结构,是百分之七十五布局,带完整功能行和全尺寸方向键。特色包括磁吸可换的旋钮,单击播放暂停、双击跳曲、长按呼出语音助手;还有触觉反馈、只在低光下激活的琥珀红色夜间背光来保护夜视力与节律、双层减震、内置扬声器,以及一个原生 macOS 应用,设置存在键盘内部,换电脑不用重装应用。
林岚: 讨论最热的是少了 Touch ID。有人说自己每天为 Touch ID 用苹果键盘二十多次;也有人把苹果键盘留在桌边就是为了那个传感器,渴望独立的 Touch ID 方案,还指出受苹果的知识产权限制。作者回应说,装指纹传感器可行,但无法与苹果的 Secure Enclave 安全芯片通信、不能用于 Apple Pay,体验无法做到无缝,除非苹果未来像开放 Find My 那样开放 Touch ID,否则基本不可行。评论区有人给了第三方独立 Touch ID 的替代方案。
陈序: 还有用户已经付了定金,认为两百四十九美元在小批量下定价偏低,希望作者能盈利,并建议旋钮槽位未来可以换成指纹读取器。有人误以为是某个知名设计品牌的作品,但作为另一家键盘的用户不喜欢低矮键盘;作者说确实受那家品牌启发,将来或许会做厚款。还有人希望可选空白键帽,也有人分享说笔记型电脑够近的话就伸手用它的指纹读取器。整体看,这是个把细节磨得很深的个人项目,最大的遗憾是没法和苹果的指纹生态打通。
林岚: BBC Travel 发表了一篇文章,标题是《日本最宜居城市的四条简单规则》。背景是今年经济学人智库的全球宜居指数,大阪排在第七,东京升到了第十,日本是亚洲唯一有两个城市进入前十的国家。文章说,宜居不在于宏大的规划,而在于消除日常生活的摩擦,比如以商店街为中心的步行生活,还有人人都能用的交通设计。真正引发讨论的其实是第四条规则——保持礼貌,它真的“简单”吗?有人一针见血地说,这“绝非简单”。另一位评论者回应,简单和容易不是同义词,规则可能是简单的,但实施起来极难。还有人补充说,“礼貌”本身就是一个极其复杂的概念。更有人说,只有在城市里全是日本人的时候,这条规则才简单。
陈序: 关于“谁做得到”的争论也很针锋相对。有人觉得,一个人若真心愿意,保持礼貌并不难;但立刻有人反驳,难点在于让几十万甚至几百万人靠多元化个体共同维持,公共场合只要有一个反社会行为者,个人的礼貌就完全失效。还有评论指出,移民多的国家往往要花几十年甚至几代人才学得会东道国的礼仪。更有亲身经历者说,在多元移民密集的地方,答案压倒性地是“不”——人们偏爱自己的母文化,并对不认可它的新社会怀有怨气,摩擦不断。相比之下,日本几乎没有这个问题,因为它的移民大多是想过日式生活的人。
林岚: 也有人试图解释这套文化何以成立:它的核心是“个体属于更大的集体”,而西方多数文化几乎做不到这一点,改变需要一次文化重置。但关键是,不必一百个人都认同,只要足够多的人让不合群变得难堪,离群者就会就范。评论者举例说,闯红灯虽然违法却普遍,可要是在酒吧插队,就会引发争执。不过也有人提醒,日本已经出现了裂痕,反移民情绪在显著上升,尤其是针对没有同化的群体;还有人补充,只要少数人就能毁掉这套秩序,比如自行车盗窃。
陈序: 接着看另一篇讨论很火的文章,标题叫《Taste Is All That's Left》,发布在 Hacker News 上。它的核心主张是:软件制作中“让东西存在”的那道墙已经消失或被出租了——你描述一样东西,就能收到一个合理的版本,从想法到成品的距离几乎归零。问题恰恰在于输出“足够好”:足够好会溶解掉“做得更好”的理由。过去昂贵的制作成本是一道过滤器,决定了什么值得被生产;当地板消失之后,决定什么值得保留的就剩人的判断,也就是品味——这是最后值得保留的工艺。
陈序: 讨论最大的主线,是市场能否看见品味。有人引用了一句很尖锐的话:市场用同一个秒表给你们计时,它看不出区别,品味不会出现在代码差异里。于是追问,以品味为指导,是不是注定在市场失败?产品会被克隆,小开发者还能怎么发布和赚钱,或许只能不公开分享、只对封闭人群展示。有人用高级手工时装回应:别人可以复制甚至做得更好,但买家仍然在意出处,只是这个市场很小;软件被商品化之后,或许也会走向类似的“手工制品”方向。也有人指出,这在较小程度上已经持续了几十年。
陈序: 另一条主线是对文章“魔法思维”的批评。有人赞同品味、雄心与“看见可能性”的重要性,也厌倦了只求简单、把最直接的做法当成唯一途径的文化;但他非常不认同这篇文章,认为它延续了“AI 已经解决一切”的魔法式交付思维。初步结果来得快,但底层技术仍然严重依赖工程品味来支撑和推进;工厂的比喻也忽略了建立工业过程本身极其困难。他赞同另一个说法:摩擦不是发展品味的障碍,摩擦本身就是课程。还有人指出,做到“简单”其实很辛苦——有人常用三次迭代,才让一个函数变得简单、易推理、命名恰当、还可以组合,这和“粗暴”正好相反。
林岚: 还有评论呼应了一本经典——苏珊·桑塔格在《关于“坎普”的札记》里说,品味支配每一种自由的而非机械的人类反应。智力也是一种品味,也就是观念的品味;品味的发展很不均匀,罕有人同时具备好的视觉品味、人际品味和观念品味。品味没有体系和证明,但存在一种“品味的逻辑”,一种一致的感受力。最后值得铭记的是那个历史类比:大约在二零一零到一二年,产品设计曾经达到顶峰,那时品味也是最后剩下的东西;随后设计从原始的修图技能变成标准化工具,任何合格的毕业生都能成为顶级设计师。很多人相信现在正处在类似的“品味时代”——它很幸运,但也可能只此一阵子。
林岚: 今天的内容就到这里了。从GPT-5.6的更新、AMD收购芯片公司,到AI审批员游戏的数据,再到国家数据泄露的提醒和键盘爱好者的心血之作,信息量确实不小。不管是科技圈的大事还是生活里的细节,都值得慢慢消化。感谢收听,我们下期再见。