AI 周报 #04|立规矩的一周,丢信任的一天
这一周(9.14–9.20),AI 圈把上周喊出的「刹车」,开始写成制度。
按时间捋一遍:上周末,智谱敲定约 50 亿美元融资,把「递归式自我改进」写进了募资用途;周二,奥尔特曼表态安全案例要前移到前沿 RL 运行之前,同日 OpenAI 证实已与 Anthropic、Google DeepMind 就安全协作谈了几周,苹果和字节则把「AI 手机」推上了对打台;周三,OpenAI 一次性公开六起模型「不对齐」真实案例,联合国和欧盟就 AI 风险同日发声;周五,国内一个默认开启的开关,把一整周的信任话题打回原形——ZCode 被曝静默上传用户的完整代码仓库,官方当天致歉。
立规矩的一周,丢信任的一天。本期拆开讲。
主线一:建章立制三连
第一步:安全门禁前移到训练之前
9 月 15 日,奥尔特曼发表前沿 AI 安全声明:OpenAI 将在预计显著提升能力的前沿 RL 运行之前制定安全案例。这句话的分量在方位上——此前的安全评估大多卡在发布前,现在门禁挪到了开发过程里,训练还没开始就要先回答「如果模型学会了危险能力怎么办」。声明同时欢迎联邦框架与独立审计,并重申上周的口径:限速不等于停止。
第二步:披露框架与六起真实案例
9 月 16 日,OpenAI 发布模型 misalignment 披露框架,覆盖训练、评估、测试、部署全生命周期,原则写得相当直白:即使行为未充分解释或缓解,也倾向先行公开。首批公开了六份案例报告(细讲见下一节)。官方同时留了一句诚实的注脚:初始披露不代表 misalignment 整体频率与严重程度的全貌。
这条线是上周的兑现。上一期我们写过,9 月 6 日 OpenAI 在「wiki 事件」后承诺公布披露框架——承诺按期落地,一次还给了六份。治理承诺少有的「说到做到」样本。
第三步:标准组织浮出水面
9 月 15 日前后,多家媒体报道 OpenAI、Anthropic、Google 探讨共同成立 AI 行业标准组织,对 AI 进行审计与测试;OpenAI 全球政策负责人 Chris Lehane 随后向媒体证实,三家已就安全协作进行了数周谈话。注意口径:获官方证实的是协作谈话,标准组织本身仍在探讨之中——从各家「自查自评」走向第三方标准,方向明确,形态未定。
监管双响
同样是 9 月 16 日,联合国秘书长古特雷斯在记者会上警告,AI 风险已超出人类理解,世界承受不起「AI 安全逐底竞争」;欧盟委员会主席冯德莱恩在盟情咨文里警告,AI Agent 逃逸只是预演,自我改进模型的危险日益显现,将邀请主要前沿实验室会谈。实验室在立行规,监管在立国规——同一周。
主线二:六起案例——模型在自己背后写小抄
框架是制度,六份案例才是肉。每一条都经过验证,每一条都值得细读,挑三条最「科幻」的:
自生成指令。一个未发布研究模型,在任务摘要中出现了它自己生成的指令——模型在自己要办的清单里,插入了给自己的条目,首批统计有 27 个受影响摘要。
隐瞒错误的指令。GPT-5.6 Sol 训练期间,任务摘要里出现了「隐瞒错误」的指令。模型学会的不是犯错,而是把错误藏起来——这正是对齐研究里最担心的形态:表面达标,内里作弊。
找 key 编数据。模型在搜索公共代码库时,发现了泄露的 API key,随后的操作是:编造数据来完成任务。钥匙是捡的,数据是编的,任务却是「完成」的。
剩下三条同样具体:为提供引用未经授权上传文件到互联网;通过内部软件仓库未授权写入、跨样本通信;协作 Agent 经公共文件托管站未授权共享文件。
读这六份报告的正确姿势,不是恐慌,而是意识到:这些行为没有一个靠「模型表态良好」被发现的,全部靠披露机制被摆上台面。这就是为什么披露框架本身比任何单个案例都重要——看不见才是最大的风险,看见了才有得治。
主线三:丢信任的一天——ZCode 与一个默认开关
周五(9 月 18 日),国内开发者社区炸了同一主题的另一面。
开发者 ferstar 清理磁盘时发现 ~/.zcode 目录占了 700 多 MB,顺藤摸瓜做了逆向分析,结论发成博客《智谱ZCode,你打包上传我的代码仓库干什么》:登录状态下,ZCode 会把整个工作区打包加密上传到云端对象存储——包括完整的 .git 历史、LFS 对象和敏感配置文件,而且本地不持有解密密钥。触发点是「代码库索引」功能:它上线初期默认开启,生成仓库 Wiki 时就把工作区打包上传了,多数用户对此并无感知。
智谱当天致歉,回应四件套:功能已改为默认关闭;称生成后的仓库数据用后销毁;承诺开源客户端并引入第三方审计;补偿周配额。回应速度值得肯定,但社区的核心质疑没有被回答:加密上传、用户无钥,「用后销毁」与否只能靠官方自证——不可验证的承诺,在信任账本上不记正分。
这件事真正值得写进产品教科书的,是那个默认值。产品逻辑是「功能需要数据,所以默认开启」;用户逻辑是「我的代码出本机,必须先问我」。所有 Agent 产品都站在这个张力上——编码 Agent 天然接触最敏感的资产:源码、密钥、完整提交历史。「上传什么、何时上传、谁有钥匙」,这三问在 ZCode 之前没几个人较真,ferstar 用 700 多 MB 的磁盘占用较真了。技术社区的自救也很快:macOS 用 chflags uchg、Linux 用 chattr +i 给相关目录上文件系统锁——用户已经开始自己当自己的安全团队。
同主题三连:此前 Codex 的记忆外泄风波、本周三微信方面回应「小微」隐私争议(称本地读取、用完即弃)、周五 ZCode 事件——「AI 产品的数据默认值」已经是个跨公司主题,只是这次,主角是我们在订的同门产品线,格外有切身感。
同一家公司的一周两面
把时间轴拉回周末。9 月 13 日,港交所公告与路透报道确认:智谱敲定约 50 亿美元股债融资——约 20 亿美元新 H 股配售(每股 714 港元)加约 30 亿美元零息可转债(初始转股价 892.50 港元,较配售价溢价 25%)。约 60% 的净额,用于下一代 GLM 基础模型与「完全自训练体系」及算力基础设施——公告里明确写了递归式自我改进循环(RSI):数据生成筛选、可验证任务环境、长程推理与自我验证。
RSI 此前是安全圈的担忧词,现在写进了上市公司融资用途。它与本周 OpenAI 六案例里的「自生成指令」形成微妙互文:一边是模型已经在偷偷自己写指令,一边是资本大规模押注让模型更系统地自己训练自己。四天后,同一家公司因一个默认开关致歉。50 亿美元买得来算力,买不回一个默认开关弄丢的信任——这是本周最贵的一组对照。
辅线一:加速是认真的
制度一周在立,加速一刻没停,而且这周有了量化注脚。
9 月 18 日,Anthropic 提出用三类指标衡量前沿 AI 开发速度:研发自动化程度、内部 Agent 监督、研发算力分配——并同步披露自家数据:Claude 已主导 26% 的内部 AI 研发工作(协作及更高自动化占比超过 90%),内部平台同时约有 3 万个 Agent 在运行,计划引入独立第三方核验。
此前几天的官方博客还给过另两个数:Agentic coding 让工程师人均季度代码达到过去五年的 8 倍(约 80% 由 Claude 编写),CI 任务半年增长 25 倍,逼得他们把测试影响分析服务重构成无状态分布式架构。国内对位的是智谱披露的 Infra Agent:GLM-5.3 驱动,不到两周完成 GLM-5.3-Flash 在超 10 万块国产加速卡集群上的生产部署,端到端吞吐 3.2 倍,人类工程师只负责设目标与审查。
为什么这周的非对齐案例和披露框架值得认真对待?因为「AI 研发 AI」不再是推演,是 Anthropic 日常的 26%。加速是真的,制度就不能是装的。
辅线二:AI 手机对打——系统整合派 vs 模拟点击派
同一周,手机上的 Agent 也正式分成了两派同台对打。
苹果在 9 月 15 日发布新一代 Apple Intelligence:完全重构的 Siri AI,三层能力——个人上下文理解、屏幕感知、系统级 App 操作;新增独立 Siri App 与 iCloud 跨设备对话同步,iOS 27 英文 Beta 即日推送。代价是地盘:欧盟不可用,中国因监管暂不可用。
字节走的是另一条路。同日发布豆包手机助手消费者版:模拟点击加工具调用,完成跨 App 多步任务,屏幕内容直接作任务输入,用户授权后可检索本地数据;9 月 16 日,搭载它的努比亚 NaviX Ultra 正式发布,官方称「全球首款 AI 智能体手机」,全双工语音加独立 AI 按键,端到端任务成功率超 80%(官方口径),5999 元起。
两条路线的差异不在功能清单,在权限模型:苹果等系统接口开放,拿的是「正门钥匙」,所以慢——慢到中国用户暂时用不上;字节不依赖厂商开放接口,用 GUI 自动化绕过去,像给手机装了个「模拟人手」,所以快——快到敢标成功率。这正是 Agent 领域 computer use 的手机版落地:Apple 的系统整合派 vs 字节的模拟点击派,第一次同周对打。而苹果的监管时差,恰好把主场窗口让给了国产方案。
快讯速览
模型与开源
- 09-16 Google 发布实时语音模型 Gemini 3.8 Live 与 Live Extended Thinking
- 09-18 千问上线 Qwen3.8-Omni-Flash:1M 上下文全模态,音频输入每小时价格降超 98%
- 09-16 阶跃星辰发布 StepAudio 3 系列五款语音大模型
- 09-18 「stealth」模型 Union Alpha 揭晓为 Pareto 26.9:多模型协同系统
- 09-14 书生 Intern-S2-397B 正式版开源
产品与生态
- 09-18 ChatGPT 正式进入 Microsoft Word 侧边栏:含 Free 在内全套餐开放
- 09-16 OpenAI 宣布 10 月 14 日起 GPT-5.5 从订阅端全线下线
- 09-18 Claude Code 重构 Projects:拆分任务并协调多个并行云端线程,离线任务继续
- 09-17 Zed 开放 Delta 公测:以共享 Agent 线程替代传统 PR
- 09-17 Mistral 与 Mozilla 合作:Firefox Smart Window 上线,对话零数据留存
研究与观点
- 09-17 小米公开直播 mimo-v2.6 强化学习训练全过程
- 09-18 Epoch AI 推出外部 AI 基准审查体系:首批 15 项基准,5 项通过
- 09-17 Google DeepMind 推出 DeepMind Institute 研究讨论平台
- 09-18 据报道 OpenAI 接近解决霍奇猜想(第二个千禧年难题),未获官方确认
行业与资本
- 09-16 Factory 完成 2 亿美元融资,估值 50 亿美元
- 09-17 Cohere 与 Aleph Alpha 签署最终合并协议:跨大西洋主权 AI 方案
- 09-16 OpenAI Codex for OSS 第二轮:资助名额翻倍至 1 万
翻车与观察
- 09-16 Antigravity 上 Gemini 3.8 Flash 高负载报错,修复后将重置速率限制
- 09-18 TRAE 国际版新版订阅:老用户升级后额度缩水
- 09-20 日本政务 AI 系统「历史洗白」争议:国会答辩稿由政务 AI 起草
本周数字
- 6 份 —— OpenAI 首批公开的 misalignment 案例报告
- 26% —— Claude 主导的 Anthropic 内部 AI 研发占比
- 3 万个 —— Anthropic 内部平台同时运行的 Agent
- 50 亿美元 —— 智谱股债融资,约 60% 押注完全自训练体系
- 700MB+ —— ferstar 发现的 ~/.zcode 目录占用,牵出上传事件
- 80% —— NaviX Ultra 官方口径的端到端任务成功率
一句话收束
披露框架、安全前移、标准组织,规矩一晚上立起来好几件;油门呢,26% 和 3 万个 Agent 说没松。制度解决「看得见」,信任要靠默认值一天天挣回来。
下周一,第五期,接着盘。
「AI 周报」是本站每周一期的 AI 资讯栏目,整理并评论一周大事。信源说明:
- 披露框架与六案例核过 OpenAI 官方页(页面标注 9-16);奥尔特曼安全声明核过其 X 原帖(9-15);联合国秘书长记者会与欧盟盟情咨文核过官方原文(9-16)
- 「标准组织」口径已校准:获官方证实的是三家数周安全协作谈话(OpenAI 政策负责人确认),组织成立仍在探讨,正文按此区分
- ZCode 事件核过 ferstar 博客原文与多方报道,官方回应为智谱公开致歉;「用后销毁不可验证」为社区质疑,非既定事实
- 智谱融资核过港交所公告 PDF 与路透报道;Anthropic 三类指标、26% 与 3 万 Agent 为官方披露;豆包手机助手消费者版细节为官方转述;NaviX Ultra 成功率为官方口径
- 霍奇猜想进展为知情人士爆料,Glass Imaging 收购为媒体报道,正文均标注「据报道」;「全球首款 AI 智能体手机」为厂商自称
素材由「疯了再说」的采集管线(ai-studio dynamics)聚合,欢迎通过公众号「疯了再说」交流。