Blog · Bilingual research notes

Reading series

从模型如何改进自己,到它如何在隐状态里继续计算。

Two evidence-led series, each with twelve articles in Chinese and English.

NEW SERIES · 12 ARTICLES

Hidden-state reasoning and looped Transformers

沿计算路径理解连续潜在推理、循环深度、停机、成本与可证伪实验。

Mechanisms, evidence boundaries, and experiments for computation beyond visible tokens.

Read 中文 / English →

Recursive self-improvement

从答案修订、经验保留,到改进器演化。

  1. 01

    01–02 · 定义与修改准则 / Foundations

    AI 修好了一个 bug,然后呢?

    An AI Fixed a Bug. What Happens Next?

    一次 bug 修复,怎样成为下一项任务能用上的经验,或改变下一次修复的程序?

  2. 02

    AI 凭什么接受一次自我修改?

    When Should an AI Accept Its Own Rewrite?

    一项自修改保证,究竟相对于什么目标和假设成立?

  3. 03

    03–05 · 学习与经验保留 / Learning & memory

    模型能从自己生成的数据中学到什么?

    What Can a Model Learn from Its Own Outputs?

    模型生成答案、评分和练习时,可信训练信号从哪里来?

  4. 04

    合成数据会让模型越学越差吗?

    Does Synthetic Data Inevitably Cause Model Collapse?

    为什么替换旧数据与累积新数据会产生不同的代际风险?

  5. 05

    不改模型权重,经验能保留多久?

    How Long Can Improvement Last Without Updating Weights?

    怎样区分一次修订、同题重试和跨任务经验积累?

  6. 06

    06–08 · 自改系统与改进器 / Systems & improvers

    自动写出好程序,等于学会改进自己吗?

    Does Discovering Better Programs Mean Learning to Improve Yourself?

    自动程序搜索与自动研究,分别把哪些部分放进了循环?

  7. 07

    让 agent 改写自己,究竟闭合了哪一层?

    What Loop Closes When an Agent Rewrites Itself?

    把改进器纳入可编辑对象后,还剩哪些外层规则固定不变?

  8. 08

    怎样证明系统更会“产生改进”了?

    How Do We Measure a Better Improver?

    怎样把任务能力提高,与产生后继改进的能力提高分开?

  9. 09

    09–12 · 评估、加速与实验 / Evaluation & experiments

    分数变高时,任务还相同吗?

    When the Score Rises, Is It Still the Same Task?

    当测试、日志或评价器也会变化,什么让前后分数继续可比?

  10. 10

    AI 研究能力的曲线,究竟测量了什么?

    What Do AI Research Benchmarks Actually Measure?

    预算、任务时间跨度和候选选择,怎样改变研究能力的解释?

  11. 11

    有正反馈,为什么还不一定持续加速?

    Why Positive Feedback Does Not Guarantee Sustained Acceleration

    系统持续进步,与进步速度持续提高之间还差什么条件?

  12. 12

    下一项 RSI 实验,怎样让结果更有解释力?

    How to Design a More Informative RSI Experiment

    一项实验怎样同时检查持久性、改进器收益、可信评价和真正的后继交接?