Andrej Karpathy 表示,语言模型能力提升后,人的工作将更多转向监督和理解输出;他建议用 ASD-STE100 受控语言解释问题,必要时只要求 80% 贴合度,并生成图表、交互网页和定制讲解视频。
Andrej Karpathy 在 X 发文提出,随着语言模型能力增强,人的工作重心将更多转向监督和理解模型输出,模型也可按要求生成用于解释结果的定制内容。他建议让模型采用 ASD-STE100 受控语言说明问题;这套规范原本用于航空航天维护文档,要求较严格,因此他有时只要求输出达到 80% 的贴合度。他还建议生成图表和交互网页,并最看好可针对任意主题定制的讲解视频;据其说明,这种方式已经开始见效。他认为,当智能和代码供给增加后,网页应用、讲解视频等体量较大的一次性定制产物也可交由模型生成,而这类内容过去通常不值得专门制作。
Anthropic 开发者账号 ClaudeDevs 宣布 You should Know 进入 Claude Code。该插件通过 sideagent 检查 Claude 输出,提示用户可能遗漏的重要信息,并可用指定命令启用。
Claude Code 已新增 You should Know 插件,消息由 Anthropic 开发者账号 ClaudeDevs 发布。官方表示,该插件会扫描 Claude 生成的输出,从中找出用户可能忽略、但有助于掌握当前进展的重要信息。它以 mod 形式实现,运行时会派生一个 sideagent,由该 sideagent 负责观察 Claude 的输出。用户可在 Claude Code 中运行 /plugin enable cc-plugin-you-should-know@builtin 启用该插件。
Cua 发布面向 AI agent 的桌面应用 Cua Spaces,并于发布当日登陆 macOS。该应用可从官网免费下载且源码可用,用于创建可由 agent 直接操作的沙箱虚拟电脑。
Cua 在 X 上宣布推出桌面应用 Cua Spaces,该产品在公告当天登陆 macOS,可从 Cua 官网免费下载,源码可用。它用于创建和管理 Space;每个 Space 都是运行 cua-spacesd 的沙箱虚拟电脑,AI agent 可直接操作,所需权限已预先授予,工具也已预装。macOS 镜像在本机构建,同时支持运行 Linux 镜像。Teleport 可把本地应用的现有会话转入 Space,让 agent 无需再次登录;系统读取任何内容前都需用户确认,涉及敏感项目时还需 Touch ID,传入数据默认锁在本机 Keyvault 中。用户可限定各 Space 能接收的网站和文件,并删除其他内容。用户与 agent 共用同一桌面,但分别拥有独立光标,用户可随时接管或交回控制权。Space 可运行在本机 Mac、自有 Mac mini 或 Linux 机器上,也可连接用户自己的云环境;所有 Space 可统一列出,并通过实时桌面流查看。
剑桥大学 AI 科学与政策项目 CASP 发布研究,认为自动化 AI 研发可能将数年进展压缩为数月或更短,并呼吁政策制定者尽快了解进展、制定引导与约束方法。
剑桥大学 AI 科学与政策项目 CASP 发布研究文章,评估自动化 AI 研发触发智能爆炸的证据、潜在影响与政策应对,署名作者包括 Geoffrey Hinton、Yoshua Bengio 和 Dawn Song。文章称,与一年前相比,AI 系统目前已经编写开发这些系统的公司内部的大部分代码,并正朝着在几年内自动化大部分、甚至全部 AI 研发工作的方向发展。据其说明,研发流程进一步自动化后,数年进展可能被压缩至数月或更短,现有初步证据表明这种情况可能发生。
作者表示,这一判断仍存在很大不确定性;如果智能爆炸发生,AI 带来的益处可能更早出现,但也可能产生三类极端风险:能力增长超过社会的应对速度、人类失去对超人 AI 系统的控制,以及国家、公司、政府部门内部和彼此之间的权力制衡受到严重侵蚀。研究建议政策制定者尽快掌握 AI 研发自动化的更多情况,开发引导和约束智能爆炸的方法,并为社会适应其影响做准备。Geoffrey Hinton 另行发帖称,递归自我改进导致智能爆炸的设想过去并不迫近,但许多领先研究者现在认为它可能很快发生。