预测:在人工智能的下一个阶段,一些进步将来自于数据集和大型语言模型(LLM)的*规模扩大*,而许多进步现在将来自于*规模缩小*。
更大的数据集/模型不再等于更好。
规模扩大:在一些像多模态这样的前沿领域,我们很可能还远未达到数据规模饱和(例如图像、视频、时间序列、运动/控制等),我们将继续从规模化数据/LLM大小中看到从零到一的重大变化。在那些有现成的合成数据生成器可以利用的地方(例如视频游戏、游戏玩法、逻辑引擎等),这将特别有力。
规模缩小:在文本/聊天等领域,向更好、更大的万金油通才模型的规模化将会收益递减,这是由于资源(互联网上的数据量限制)和耐心的枯竭(商业/开发者想要在实际用例上获得可靠的结果,而不是更好的智力游戏记忆者...)。在这里,基础LLMs将继续成为商品化,而游戏将是关于在小型、精心策划的用例/领域特定数据集上进行训练/调整,以在特定任务上获得高性能(准确性和成本)。
我们已经在SnorkelAI看到了来自后者的惊人结果!
直觉:
- 如果你在训练一个幼儿读书/说话,原始数据的量很重要。
- 如果你在训练一名新毕业的员工——你希望有一个精心策划的课程表,针对他们实际上应该学习的任务。你不在乎他们记住了多少互联网的智力游戏...你希望他们在一组特定任务上以高准确性和速度表现出色。
这是我们思考LLM“规模化”方式的一大转变——这一切都关乎你如何策划和开发数据!