原因:

1:训练效率

2:BERT训练、推理的不一致

3:上下文学习,

4:scaling law,scaling行为可预测

5:范式统一,统一建模成序列生成,BERT,KV Catch

6:更强的因果推理能力,decoder-only因果注意力

7:en-de效果也不错,但是scaling研究更复杂,不确定性更大,

Logo

Agent 垂直技术社区,欢迎活跃、内容共建。

更多推荐