「有些模型就是不想学?」循环模型为什么越想越错?

2026-07-16 · 快讯 · 97253次阅读

编辑|山辉十多年前,Ilya Sutskever 说过这么一句话。「模型就是想学习。」Dario Amodei 在采访中转述 Ilya Sutskever 的说法。图源:Dwarkesh Podcast。只要解决好数据和算力的问题,模型会自己找到学习的方法。后来发生的事情我们都知道。模型越做越大。训练数据越用越多,算力投入一路上涨,模型能力被一层层解锁。但当研究者把目光聚焦在循环网络和隐空间上时,一切都变了。循环模型能够在隐空间中反复计算,按照设想,同一组网络层多运行几轮,模型就能获得更多计算时间,遇到难题也可以多「想」一会儿。但现实并不如此美好。不少模型只擅长使用训练时见过的循环深度,如果再

快讯 | 转载需注明来源