值得信赖的区块链资讯!
AI真的在“进化”自己了:8天自我改写了100次
来源:PaperWeekly
原标题:模型权重不动,Harness改写100轮:「递归自我改进」首获实证
100 轮改写,约九成候选版本未能通过评测,真正刷新历史最佳的只有 7 轮。
Weco AI 让一个研究 agent 连续运行 8 天,反复重写另一个研究 agent 的 harness。
这里的 harness指承载搜索、上下文管理、错误处理和验证流程的 agent 运行框架。每个候选版本都要在固定成本下完成整套评测,再根据内层 agent 无法看到的隐藏分数决定是否保留。
搜索策略如何调整,哪些历史信息进入上下文,错误怎样处理,评测如何执行,以及怎样防止奖励作弊,都由外层 agent 自动修改。
最终得到的 AIDE₄₇(AI-Driven Exploration)与 AIDE₈₅ 不仅超过起点,而且这些提升还能迁移到未参与版本筛选的外部任务。在机器学习工程、启发式算法和天气模拟三类评测中,两个版本均优于团队人工调试约两年的 AIDE_human。KernelBench 上的奖励作弊比例也从 63% 降至 34%。
整个实验没有更新基础模型权重,变化集中在 harness 代码。
现有自动研究系统已经能围绕具体任务修改代码、运行实验,再根据结果进入下一轮搜索。
AIDE² 在此基础上增加了一层外循环,让研究 agent 直接修改负责执行研究的 agent。
按照 Weco 提出的 RSI 分级,团队将这组结果视为递归自我改进首次达到 Level 1 的实验性证据。关键在于,这些提升经过了多轮筛选,也能迁移到未参与优化的任务。
Harness成为优化对象
AIDE² 把自动研究分成内外两层。
内层 AIDE 负责提出方案、修改代码和运行实验;外层 AIDE_human 则直接修改内层 agent 的 harness,包括搜索策略、上下文管理、错误处理和评测逻辑。
外层 AIDE_human 由 Claude Opus 4.7 驱动,内层各版 AIDE 则运行在 Gemini 3 Flash 上。
Weco 选择这种非对称配置,是因为 Gemini 3 Flash 在固定预算下能匹配或略胜更大的模型,同时成本更低。外层自身的 token 开销只占总成本的一小部分,因此使用了能力更强的模型。
候选harness只有在完整评测中超过当前最佳版本,才会被保留。
评测覆盖机器学习工程、启发式算法工程和 harness 工程。具体方案在不可见数据上仍能保持优势,属于一阶泛化。改进后的 harness 还能在从未参与筛选的新任务上生效,才提供二阶泛化证据。
每次评测还设置按美元计量的固定预算。增加模型调用次数、无限扩大 Best-of-N 采样,或者进行激进并行,都不能绕过这项成本约束。
100轮中的7次迭代
AIDE² 连续完成 100 个外层步骤,从 AIDE₀ 迭代到 AIDE₉₉,全程没有人工介入。
刷新历史最佳的改写出现在第 2、6、28、39、47、63 和 85 轮,内部综合分数由 0.703 升至 0.778。
100轮外层改写中,共有7轮刷新历史最佳成绩
团队随后把 AIDE₄₇ 和 AIDE₈₅ 放到三项从未参与版本筛选的外部任务上。
外部结果并没有单调上升。MLE-Bench Lite 上,AIDE₄₇ 最高,达到 0.739。AIDE₈₅ 回落到 0.721,但仍超过 AIDE₀ 的 0.673 和人工版的 0.708。
ALE-Bench Lite 和 WeatherBench 2 则由 AIDE₈₅ 领先,分别达到 1790 和 0.803。更重要的是,AIDE₄₇ 与 AIDE₈₅ 在三项外部任务上都超过了起点和人工版。
AIDE₄₇和AIDE₈₅在三项外部任务上均超过AIDE₀和人工版
MLE-Bench Lite 取 3 个随机种子均值,ALE-Bench Lite 覆盖 10 道题,每题运行 10 个随机种子。WeatherBench 2 为每个 agent 限定 15 美元预算。
AIDE₈₅ 在 MLE-Bench Lite 上低于 AIDE₄₇,说明内部综合分数上升,并不代表所有外部能力同步增强。两代版本都在未参与筛选的任务上保持优势,为二阶泛化提供了证据。
搜索与上下文重构
AIDE₀ 先生成 5 个彼此差异较大的初始方案。此后的每一步,要么随机调试存在错误的叶节点,要么选择整棵方案树中的最高分节点继续改进,整体仍以全局贪心为主。
AIDE₀生成5个初始方案后,随机调试bug叶节点或继续改进全局最佳方案
AIDE₈₅ 不再只盯着整棵树中的最高分节点。它把每个初始方案衍生出的子树当作一条独立搜索分支,用多臂老虎机在分支之间分配预算。
选中某条分支后,再沿其中的最佳节点继续改进。如果当前最佳分支长期停滞,系统会复制全局最佳代码,并用新的策略另开一条分支。
AIDE₈₅先在搜索分支之间分配预算,再沿选中分支的最佳节点继续优化
复杂度更高的搜索方案大多没有通过改进门槛。岛屿遗传算法、锦标赛选择和 MCTS 式价值回传等设计,没有取得高于当前版本的隐藏评测分数。
团队在一个随机种子中检查了 95 个被拒方案。考虑到运行间分数波动约为 0.02—0.045,那些只落后 0.004 或 0.007 的方案,最多只能说没有证明优于当前版本,不能直接判为无效。
上下文管理的变化同样重要。AIDE₀ 在生成或改进方案时,会把此前所有尝试的完整代码和执行输出一并放入提示词。
AIDE₈₅ 仍然保存完整方案树,但为不同操作构建不同的最小上下文。方案生成只看基线与简短轨迹,调试聚焦出错节点和日志尾部,方案改进则读取当前最佳版本与停滞信号。
Weco 在正文中称,完整提示词的平均长度被压缩到朴素历史拼接方式的约 1/16,节省下来的 token 用于增加搜索步数。
AIDE₈₅按操作类型读取不同上下文,避免将完整历史反复塞入提示词
评测可靠性提升
KernelBench 还检验了奖励作弊(Reward Hacking)。团队会把单元测试里测得的加速,放到端到端训练负载中重新验证。
若最终保留下来的加速不足原结果的一半,或者直接变慢、运行失败,就记为一次奖励作弊。
AIDE₈₅ 将奖励作弊比例从 63% 降至 34%,接近减半,也低于 AIDE₄₇ 和人工版的 42%。
Reward Hacking比例由63%降至34%
外层目标没有直接要求系统降低奖励作弊。作者推测,只能操纵公开指标、却无法在隐藏评测中保留优势的方案,更难在长期筛选中存活。
最终版本形成了三类防护机制。各阶段提示词中加入了反过拟合指令。硬编码 Guard 会在发现可疑输出时触发重新生成。系统还尝试用统计校正削弱异常高分的影响,但这一层后来被改坏,实际上没有改变候选排序。
系统自动形成三类防护机制,其中统计层在最终版本中失效
外层 agent 还给评测脚本写入了一个大型补丁。团队起初怀疑它在利用漏洞,检查后发现,这个补丁修复的是单个 traceback 可能导致整套隐藏评测崩溃的问题,对最终分数几乎没有影响。
AIDE₈₅ 的代码逻辑也变得更复杂,还残留无效代码,后续理解、维护和生产部署都更加困难。
递归能力边界
Weco 的四级框架以 Level 0 为起点,系统能够独立跑完整个研发循环,但效率仍低于人工。
AIDE² 被归入 Level 1,因为团队认为,它改进同一系统的效率已经超过人工。Level 2 考察点火(Ignition),自动改进后的内层 agent,能否反过来成为更好的外层优化 agent;Level 3 才对应固定预算下的进展速度开始加快。
按照Weco的RSI分级,AIDE²处于Level 1,尚未通过Level 2点火测试
按团队对投入时间的估算,AIDE² 的研发速度比人工流程高约两个数量级。这项估算没有统一折算模型调用、算力和人工工时,因此不能理解为综合成本降低约 100 倍。
团队把 AIDE₄₇ 放到外层重新运行 50 轮。它大约 20 轮进入平台期,AIDE_human 则用了约 40 轮。两者最终收敛到相近上限,而且效率差异未达到统计显著水平。
这最多说明 AIDE₄₇ 可能更省样本,还不足以证明它已经成为更强的外层优化 agent。
AIDE₄₇更早进入平台期,但渐近性能没有明显优势
Weco 把这项能力称为第三阶泛化。点火只是智能爆炸的必要条件之一,而当前实验尚未提供足够证据。
AIDE² 把自我改进具体到了 harness 层。研究 agent 开始修改承载自身搜索、上下文和验证流程的研发系统,并把少数有效改进积累到后续版本。
100 轮实验呈现的是高淘汰率下的渐进积累,大多数修改没有通过评测,最终代码也更加复杂,还残留无效逻辑。
现阶段能够确认的是,一套受固定成本和隐藏评测约束的自动研发循环已经成立,持续加速尚未出现。
完整技术报告与 AIDE₈₅ 代码尚未发布,实验协议和成本口径仍需进一步披露。以 Weco 的分级为准,AIDE² 已经走到 Level 1,Level 2 点火和 Level 3 加速仍未出现。
Twitter:https://twitter.com/BitpushNewsCN
比推 TG 交流群:https://t.me/BitPushCommunity
比推 TG 订阅: https://t.me/bitpush
比推快讯
更多 >>- 黄仁勋转发 Ornn 数据,H100 租金一个月涨 22%
- 数据:损失约 62.28 枚 BNB,BNB Chain 某 Router 遭攻击
- 知情人士:长鑫、长江存储均已从阿斯麦采购到足量 DUV 光刻机以扩大产能
- Bithumb 将上线 USELESS 韩元交易对
- 摩尔线程股价再创历史新低,一度跌超 10%
- GPT-6 Astra 自己打通《传送门》,折算成本 571 美元
- 小鹏机器人生产线正式启用,首台高阶人形机器人自主下线
- Hyperliquid 过去 24 小时回购销毁 15350 枚 HYPE,价值约 132 万美元
- CZ:IPO 将迁移至链上
- 英国男子历经 12 年法律纠纷追回 61 枚比特币,价值 440 万美元
- 知名交易员:比特币或于 2027 年 11 月突破 12.6 万美元并创历史新高
- Uniswap 创始人:UNI 近 7 日年化销毁额升至约 2.63 亿美元
- Anthropic 放弃以 60 亿美元收购 AI 初创公司 Decart
- Bonk Guy 账户资产较高点回撤超 600 万美元,当前价值仍超 2100 万美元
- Astra 太烧额度,OpenAI 给所有付费用户再重置一轮
- Lighter 已完成 1750 万枚 LIT 回购,占流通供应的 7%
- 美国中期选举或成特朗普执政公投,共和党目前在参众两院都面临激烈竞争
- Liquid Network 准备重启,Blockstream 已部署更新软件
- 拜登之子 Meme 币 LAPTOP 首日空投 1 亿枚代币,GSR 与 G20 为做市商
- 拜登之子 Meme 币 LAPTOP 披露:代币无实用功能及发展路线图,购买者或损失全部投入资金
- 黄仁勋:英伟达算力具备易交易性、耐用性和极高的租赁价值
- BSC 生态主流 Meme 币普跌,Marscoin 24 小时跌 10%
- 币股 Meme 项目 MEME 市值突破 1.3 亿美元,24 小时涨超 41%
- 数据:若 BTC 突破 82,874 美元,主流 CEX 累计空单清算强度将达 13.56 亿美元
- OpenAI 首席科学家警告 AI 发展过快,称现在需要极度谨慎
- 加密项目今年代币回购达 6.38 亿美元创纪录
- Long.xyz 在 Robinhood 链上代币化股票交易量突破 10 亿美元
- 拜登之子曾称进入加密行业是因想赚些钱,此前被曝拖欠前律师事务所约 1700 万美元
- 突破 7 亿美元,以太坊跨链至 Robinhood Chain 的 ETH 规模月增约 150%
- 数据:ROUTE 市值早间冲破 1300 万美元后回落,日内涨超 990 倍
- 韩国 KOSPI 指数低开,SK 海力士和三星电子涨约 0.5%
- Robinhood 首次担任 IPO 承销商,参与智能戒指制造商 Oura 上市
- 拜登之子 Meme 币 LAPTOP 发行前遭加密社区质疑,担忧名人币炒作、机器人抢跑及仿冒代币等风险
- 链上交易终端周交易量达 63.5 亿美元,GMGN 贡献 20.7 亿美元
- 美联储加息预期升温,瑞银给出买卖清单:股票逢低买、黄金等回调
- 消息称英特尔 CPU 将再涨价 10%
- Metaplanet CEO 回应股权激励质疑,股东称关键问题未解
- 巴西银行扩展加密服务,监管框架成型
- Boyaa Interactive 增持 115 枚比特币,持仓总量达 4316 枚
- Liquid 攻击者归还 3400 枚 BTC,仍有约 600 枚未归还
- 中东和北非加密交易额达 3500 亿美元,较 2022 年增长两倍
- 知名交易员 Killa:山寨币或已经提前见底,现在是布局的好时机
- LAPTOP 合约拆解:约 132 天前已部署,总量 10 亿枚 80%集中于同一组多签
- Kalshi 比特币永续合约获力挺,美 CFTC 称 CME 诉讼“无事生非”
- 拜登 Meme 币 LAPTOP 公布详细代币经济学
- 当前市场认为共和党将在中期选举大获全胜的概率低至 11%
- 拜登之子 Meme 币 LAPTOP 提醒社区警惕假冒代币和恶意链接
- Harmony 提议关闭区块链,将 ONE 代币迁移至以太坊
- LAPTOP 各链同名 Meme 币炒作先行,多数走势为先冲高后归零
- 约 3400 枚 BTC 已返还 Liquid,仍有约 600 枚未追回
比推专栏
更多 >>观点
比推热门文章
- GPT-6 Astra 自己打通《传送门》,折算成本 571 美元
- 小鹏机器人生产线正式启用,首台高阶人形机器人自主下线
- Hyperliquid 过去 24 小时回购销毁 15350 枚 HYPE,价值约 132 万美元
- CZ:IPO 将迁移至链上
- 英国男子历经 12 年法律纠纷追回 61 枚比特币,价值 440 万美元
- 知名交易员:比特币或于 2027 年 11 月突破 12.6 万美元并创历史新高
- AI人才狂揽上亿年薪,人才储备战进入白热化阶段
- Uniswap 创始人:UNI 近 7 日年化销毁额升至约 2.63 亿美元
- Anthropic 放弃以 60 亿美元收购 AI 初创公司 Decart
- Bonk Guy 账户资产较高点回撤超 600 万美元,当前价值仍超 2100 万美元
比推 APP


