之前看达里奥的访谈,首次意识到后训练具备充分的潜能,是因为后训练也可以像预训练从 GPT-1 到 GPT-3 那样泛化:从可验证的环境到不怎么可验证的环境,从代码到其他的人类工作任务。那时候只是获得了这样一个启发,但并没有深刻去思考为什么它可以泛化。
今天读这篇文章,好像又得到了另一种新的启发:模型从可验证任务泛化到没那么容易验证的任务,一个很大的原因可能是模型在可验证任务中学会了长时间探索并找到结果,学会了保持耐心,学会了从过程、经验和失败中学习。
而有一些任务虽然不能得到明确的结果验证,但只要在足够长的时间内、在足够发散的思维下、在足够好的行动空间内探索,答案的质量就是成正比提高的。所以对于没那么容易验证结果的任务,其实是通过可验证任务在长程任务能力上的提升,从而得到了泛化。这是 RL 能够进行泛化的一个原因。
我之前并没有意识到这个关键节点:长程任务不再只是拓展人类有效任务的领域之一,它甚至还成了一种泛化的手段和途径。
但仍然有很多任务,即便给了足够的时间和空间,也依然无法得到结果。这类任务可能就无法通过这一途径来泛化,需要去寻找其他的解法。这也是文章中仍然存在不确定性的事项之一