Reading series
从模型如何改进自己,到它如何在隐状态里继续计算。
Two evidence-led series, each with twelve articles in Chinese and English.
Hidden-state reasoning and looped Transformers
沿计算路径理解连续潜在推理、循环深度、停机、成本与可证伪实验。
Mechanisms, evidence boundaries, and experiments for computation beyond visible tokens.
Recursive self-improvement
从答案修订、经验保留,到改进器演化。
- 01
01–02 · 定义与修改准则 / Foundations
AI 修好了一个 bug,然后呢?
An AI Fixed a Bug. What Happens Next?
一次 bug 修复,怎样成为下一项任务能用上的经验,或改变下一次修复的程序?
- 02
- 03
03–05 · 学习与经验保留 / Learning & memory
模型能从自己生成的数据中学到什么?
What Can a Model Learn from Its Own Outputs?
模型生成答案、评分和练习时,可信训练信号从哪里来?
- 04
- 05
- 06
06–08 · 自改系统与改进器 / Systems & improvers
自动写出好程序,等于学会改进自己吗?
Does Discovering Better Programs Mean Learning to Improve Yourself?
自动程序搜索与自动研究,分别把哪些部分放进了循环?
- 07
- 08
- 09
09–12 · 评估、加速与实验 / Evaluation & experiments
分数变高时,任务还相同吗?
When the Score Rises, Is It Still the Same Task?
当测试、日志或评价器也会变化,什么让前后分数继续可比?
- 10
- 11
有正反馈,为什么还不一定持续加速?
Why Positive Feedback Does Not Guarantee Sustained Acceleration
系统持续进步,与进步速度持续提高之间还差什么条件?
- 12
下一项 RSI 实验,怎样让结果更有解释力?
How to Design a More Informative RSI Experiment
一项实验怎样同时检查持久性、改进器收益、可信评价和真正的后继交接?