第13章 空手套白狼(2/2)
【畅读更新加载慢,有广告,章节不完整,请退出畅读后阅读!】
sp; 为什么未来华国的模型在测试表现上和阿美莉卡的模型差不多,但使用体验却有明显差距。就是因为针对测试的指标,进行的人工修剪成分过多了。
来自老板的文档里提前标注了:第一轮要证明失败家族这个变量是否能提供额外信息。
如果这个变量在小规模手工标注里都没有价值,那就没有必要专门写程序把它给自动化。
第一天他跑完第一组基线,普通采样加可见测试过滤后,候选程序在语法聚类上看起来很分散。
按照常规方法看,模型给出了不少不同方案。
一旦用反例探针重新测试,候选程序开始成片成片倒下。
变量名不同,循环结构不同,解法看起来不同,最后死在同一种边界条件上。
尼克盯着结果,又跑了一遍。
结果差不多。
他开始兴奋起来。
隐隐约约的感觉被程序给证实。
原本模糊的现象突然被测出来了。
团队里很多人都知道大规模采样会制造虚假的多样性,也知道候选程序之间存在同质化。
知道是一回事,能把它测出来是另一回事。
他接着按照文档里的方法训练了一个很小的策略判别器。
模型粗糙,数据不大。
它不能和AlphaCode相提并论,更谈不上对外发布。
但在这批小样本上,它已经能比语法聚类更稳定地把看起来不同、实则同源的候选程序归到一起。
当他把反例生成器加入筛选流程后,最终留下的候选解法数量少了,策略互补性明显变高。
他把结果导出成表格,又跑了三组不同随机种子。
提升幅度有波动,趋势没有消失。
语法多样性和策略多样性之间的差距,被这个小实验找到了命门。
哪怕已经到了深夜,尼克也忍不住要给巴布什金打个电话。
电话接通后,巴布什金没有寒暄:“结果怎样?”
尼克说:“结果很惊艳,我隐约觉得它找到了那条路,老板,你做到了!”
能从尼克语气里听到兴奋,显然这个小的验证效果好到出乎伊戈尔?巴布什金的预料。
他没有回答,在思考。
尼克见电话那头没有回复,于是继续说道:“在小规模验证里,这套东西确实测出了普通聚类测不到的策略坍缩。反例探针对候选程序的杀伤不是随机的。测试方案里语义有效样本量指标很有效。”
“而且,加入策略判别器之后,留下来的候选解法更接近真正不同的思路,他们之间有时候甚至能形成隐形的互补。”
伊戈尔?巴布什金说:“好,我知道了。”
说完,他挂断了电话。
伊戈尔?巴布什金陷入了两难的境地。
如果做模型的正式训练,那么无论是算力的使用还是日志记录、数据流,都没办法瞒过DeepMind和背后的谷歌。
风险会大到爆炸。
最后只能老老实实上报给谷歌的董事会。
另外一条路就是找马斯克,用推特的卡来训练。
但这同样有问题,那就没办法待价而沽了,只能拿来和马斯克抬价了,自己回不去谷歌了。
谷歌还是推特?这是一个问题。