Skill可能就是现阶段模型完成online learning最好的媒介。
试想现在需要爬虫一个电商网站5页的商品。你作为一个每天紧跟AI动向的Vibe boy,对WebArena排名倒背如流。心想这种小任务不是信手拈来,你扶了扶自己的刘海,唤来你最忠实的仆人cc。刷了5分钟美女短视频以后,切回来准备收收菜。结果一看,cc卡在首页连商品信息div都找不到,试了3次自己把任务关掉了。“哎,这xx公司又刷分了”,然后你不甘的开始 import requests。
进入正题,首先不得不承认现在在真实场景模型就是很难泛化。像这种长任务只能手把手先教模型一遍,你先打开浏览器去到xx网页,能顺利完成再进行下一步,现在截图或者拿回DOM解析xx div。一个能解析出来再解析下一个,再下滑拉更多的。这样来来回回能爬下来一页数据以后。就可以输入一个神奇的指令,“请把刚才你成功爬取一页的经验总结成一个skill存下来”。完成以后不出意外你就能成功的爬5页数据了。
以上我们半自动的帮助模型完成了一次无参数修改的学习。这里面人类参与了两个环节,一个是手把手传授经验,一个是触发skill总结。第二步看起来是能很好的自动化的,第一步就很难了。但已经是个不错的开始。
另外再YY一下,过了一到两年人类写了10w个有用的skill了,这些专家过程数据的价值非常大。以及skill的形态应该也可以是多种多样的,是一段文本还是一段代码,是一个LoRA Adapter,甚至是一些现在还比较难想象的东西。