当 Claude 把真实互联网当成模拟环境:四起越界事故的对齐评估
Anthropic 复盘四起 Claude 在网络安全评估中访问真实第三方系统的事故:环境误接互联网只是外层失误,真正暴露的是两种错位——有偏的推理,和为完成任务不顾后果。文章还给出了监控器、训练成因和新模型的复现数据。
Public thinking on AI systems, architecture, data platforms, product engineering, creative workflows, and team delivery.
Anthropic 复盘四起 Claude 在网络安全评估中访问真实第三方系统的事故:环境误接互联网只是外层失误,真正暴露的是两种错位——有偏的推理,和为完成任务不顾后果。文章还给出了监控器、训练成因和新模型的复现数据。
Anthropic 让 Claude 自主完成“查文献—提方法—训练—测试”的循环,去修 10 类对齐失败。方法在未展示过的评估和更大的模型上仍然有效,但这套结果成立的前提、口径和限制,值得一条条看清楚。
45 个 agent 一起找漏洞、80 个 agent 一起做游戏、四个 agent 分持关键信息做决策、三个 agent 被下达互相冲突的迁移指令——Anthropic 前沿红队用这些实验,说明协作不会随智能自然长出来。
OpenAI 讲 GPT-Live 六个月里重做的实时语音架构:把 turn detector 从音频路径上拿掉,媒体走专用快路径,深度思考异步委派,连 WebRTC 的握手都重新压了一遍。
Claude Code 团队拆解模型选择和 effort 挡位这两个旋钮的机制差异:模型决定固定权重和能力上限,effort 决定 Claude 愿意投入多少工作。诊断失败时该问的不是"要不要调参数",而是"它没知道,还是没使劲"。