主持:逸文 | 嘉宾:何允中(Scale AI 研究总监)、孙一铀(UC Berkeley 博士后)| 约 58 分钟
机器转写(whisper large-v3-turbo)+ 声纹聚类标注发言人,人工修正了常见误听词。个别专有名词与口语仍可能有误差,引用请以原音频为准。原节目:小宇宙 E253
Hello 大家好,欢迎回到硅谷101,我是逸文。很多投资人在和我们聊天的时候都提到了他们最近很关注的一个赛道,那就是数据。随着模型能力的不断提升,模型公司对训练数据的需求也变得越来越复杂,越来越具体。硅谷因此出现了一批增长很快的数据公司,专门为这些模型公司提供服务。
比如由三名二十多岁的年轻人创办的AfterQuery,今年四月宣布A轮融资的时候估值还是三亿美元,到了九月呢,新一轮融资就已经把它的估值推到了三十二亿美元。不到半年啊,涨到了十倍之多,创造了YC旗下公司从启动到成为独角兽的最快纪录。那我们更熟悉的几家大型数据公司呢,估值也已经达到了百亿美元的级别。去年Meta入股Scale AI的时候给出的估值超过290亿美元。Mercor去年十月这轮融资的估值也达到了100亿美元。但这些高估值背后的数据生意到底是怎么做的,外界其实很难看清。
所以啊,我也很好奇这些公司究竟在卖什么?模型公司又为什么愿意给那么多钱呢?过去提到数据标注,大家很容易想到给图片打标签,给模型的回答打分这些人工标注。现在啊,数据公司还需要请来各类行业专家,把他们的知识和工作经验转化成AI可以学习的任务。其中一类重要的数据是请专家写清楚,一个回答一份工作成果,到底满足哪些条件才算好。这套评分标准也就是我们经常听到的Rubric。再往前一步啊,数据公司还要搭出让AI实际动手的环境,配上任务工具和反馈机制,让它在里面操作软件反复尝试,并且根据结果学习。
这就是强化学习环境,也就是我们经常听到的RL Environment。与此同时呢,新的AI评测也层出不穷,从金融法律等等垂直领域到让Agent完成一整套工作流程,模型要参加的考试是越来越多了。但榜单上的分数提高了,究竟代表哪些能力变强了呢?针对榜单做优化,什么时候会让模型更好用,什么时候又会变成单纯的刷分行为?这期播客啊,我们就想把这些问题聊清楚。今天聊大模型数据范式迁移,人工标注转向可验证的RL环境,但也有观点,对机器人来说,最难构建可验证环境的场景,未必在实验室,反而在实际家庭里。
沙盒里写代码,跑一遍就知道对错,但家务是动态环境开放任务,机器人不仅要完成动作,还要稳定做好,难度极高,家庭场景验证是行业的最硬命题。如何让家务不用人操心,科沃斯钻研了28年,从扫地擦窗到割草泳池清洁,他们没急着把机器人做得像人,而是不断打磨能帮人的机器人,在真实场景稳定解决问题,为此重设清洁决策,搭建验证体系,很多功夫花在看不见的地方,家务难在哪,科沃斯的能力就长在哪。本期节目由科沃斯赞助播出,向人是很迷人的方向,但帮人才是科技最终的目的。接下来就请收听我们关于AI数据的正片。
我请来了两位非常适合聊数据这个话题的嘉宾,分别是在Scale AI负责后训练和评测研究的何允中,以及加州大学伯克利分校的博士后,Agent's Last Exam项目的研究者孙一铀。以下就是我们的对话。欢迎来到硅谷101,大家介绍一下自己吧。
OK,我叫允中,现在在Scale负责Post Training和Eval Research。大部分人关注我们可能是看我们发布的这个Benchmark,还有一些RL Data Recipe的文章,但是实际上我们其实也是给整个大模型行业提供数据,还有一些方法论的支持吧,有一点像整个行业的一个外包数据Research团队,观点都是个人观点,不代表Scale AI也跟客户没有关系。谢谢允中,
我是一铀,我现在在UC Berkeley读Post Doc,现在关注的也是Agent Evaluation这个方向。我们最近推出的工作就是一个Agent Last Exam,目标是构建于迄今为止,规模最大覆盖面最广的智能体评测基准,是由Berkeley RDI和300多位行业专家共同领导和牵头的,是希望能够衡量智能体在有可验证结果的长期,准备精致价值任务中的一些表现。目前的话,公开的任务大概有150多个,覆盖了50多个系统的行业,然后我们目标在下一次发布中直接放出1000多个任务,在每个领域上做得更深一些,我们可能几个月内就会发布V2的版本。
允中要不要给我们讲一下现在市面上的,因为也有种种的数据公司吗,你觉得大致的一个分类是什么样的?
对,可能是有一些领域专家组成的,大概是这么几个分类吧,我会觉得说机会还很多,大厂有大厂的优势,就是想进入一个领域,有比较多的资源,我觉得整个饼是越来越大。你讲到说像Mercor这样的公司是所谓的招聘公司,这个能不能再跟我们具体讲一下,招聘是一个什么样的商业模式?Serge应该不是,但是Mercor它是做招聘起家的,它有自己的一个自动AI面试的这么一些产品吧,它可能自己主打的一个重点,就是说我能够在比较短的时间内,找到足够量的专家,有这么一个专家网络。然后Serge我觉得更多的是,把这个东西in-house,这里反正有一些取舍吧,基本上每个树上可能都需要面临这么一些取舍,就是说如果我是自己完全全职培养的人,那他肯定能力强一点,但是这个灵活度就不够,产能可能会差一点。
如果是更多的依靠众包的网络,那么可能我的灵活性大一点,但是就是每个人的质量就比较难保障。然后这里面就涉及到一些质检的问题了,
比如说像Scale这些公司的一些优势,就是说我们有一些质检的经验,不光是在数据上也在人上。你中央要不要讲一下,你是什么时候加入Scale的,在当时到现在整个市场,你觉得对于数据的需求有发生什么变化吗?对,故事还挺好玩的,当时我是在Meta入股之前签的offer,我一到人就走了,所以我经历了整个大模型行业,开始不管从人才的战争,还有薪酬体系都开始go crazy的这么一个故事。当时我来之前,我的老板刘斌跟我说,有这么一个技术,各个家lab都在做,但每个人都做得不太一样,
说你赶紧进来我就能跟你讲,然后我们在这里好好做些研究,然后我来了,那个时候是Rubric Data,那个时候还比较新,可能一年多之前吧,现在Rubric感觉已经过时了,大家都在讲R-O Environment,各种各样的东西,就是这一年确实经历了非常多的变化。
其实我们关注这个话题也是因为,大概从2024年到现在,感觉整个对于数据的一个需求,发生了一个比较大的变化,因为24年之前我们在聊数据的时候,大家想到的很多还是人工标注,就是一些比较基础的数据吧,我们会需要非常多的数据来做pre-training,来训练模型,但是从2024年,其实Mercor之前有提到过,是因为deep search的兴起,导致整个行业转移到了一个所谓的agentic data,
我们会需要像你刚刚说的Rubric,然后包括RL环境,现在就是更多真实工作流数据,能不能帮我们先梳理一下这几个概念吧,我们先讲一下这个行业,从crowdsourcing data,就是这些人工标注数据到agentic数据,这个中间是经历了一个什么样的变化?
对,首先说明一下pre-training还是很重要的,不过就确实,从我身边的人的兴趣来说,大家经历了一个shift,大家觉得pre-training感觉干的有点无聊了,就是再继续scale,调数据配比,那个时候是O系列模型出来了,大家都在做reasoning,发现这个RL跑通了嘛,一下子大家兴趣都在RL上,然后RL比较有意思的一个问题就是说,我需要一个可验证的信号,可验证的信号在代码或者数学,尤其是最早的推理模型是从数学上做出来,就很简单,我这个选择题答错答对了,就知道了,或者就是一个数字算出来,但是之后大家就在想说,那我数学可以做RL了,我在其他领域呢,比如说像是这些什么医疗金融,或者就是更基础的指令遵循,这里我能不能做RL,这里它存在的一个问题就是说,它是有一些客观,不像在之前的一个阶段大家做RHF就是reward model可能没什么标打只是把大家的写号学出来然后这里面其实就有个标打只是它这个标打它比较不结构化就好像我去答这个历史考题历史考题是有标打的但是呢每个人的写法可能都不太一样就我很难做这个pattern match就是说ABCD检查你有没有答对这个时候就是一个rubric方式相当于我让一个TA拿着教授写的打分规则来给你打分然后因为这个打分规则是提前标好的是教授写的所以这个TA也不需要特别聪明这是整个大模型数据中的一个核心概念就是叫Weak to Strong to Provision就是我能不能用弱模型来监督强模型那它这里成立的条件就是说我有个专家把他脑海里的指使给写下来了这样弱的模型拿着他改卷着就行了这就是rubric data这个东西应该是火了很长一段时间但是现在还很重要但是这里面很快就把各个专家领域的rubric而就比较容易获得的收集的比较干净了看到比如说像Mercore或者SERGE的崛起其实跟这一块的专家rubric有关系但是在我中的中文字上在往前走呢就大家需要动手了比如说现在做这种代码模型或者像BEO他们做的ALE虽然它不是做代码但它需要动手要解各种各样的问题这个时候呢它就不再是说我只是验证你一个聊天的输出了那我需要是在一个agent的这个setting之下那我可能需要给它一些工具还有一些更复杂的验证方式它还包含了rubric但是可能我需要一些检查这个环境里面的变量是不是执行了这个数据库是不是写入了或者被删除了甚至如果像是我生成一些文档里面可能有一些图这个东西我还是需要rubric但是我需要一个agent来检查就变得更加多样了现在可能大家追求的比较大的一个方向就是环境它不光是我标注好的一些打分规则了而是说我可能包含了一整套我要做什么在什么样的环境里面做包括了它需要的一些工具需要执行的一些沙盒以及还有一套跟task比较相关的验证方式验证方式非常的多样比如说有这种programmatic check有这种rubric还有preference我让人选我比较喜欢哪一种
这里面我暂时还没有形成特别大的共识我又看到有点像当年rubric时代每一家要的东西都不一样就比如说像什么terminal bench他们就不要rubric他们就是task programmatic这里面又有不同的流派还挺有意思的这个很有意思EO你要不要从LE的具体的例子来跟我们讲一下需要哪些要素其实我跟云中的看法其实有一点反过来了就是云中认为现在rubric差不多已经做到头了但我的看法是我觉得rubric这一块意思专家中主观的判断其实还做的远远不够我可以先从ALE的初衷讲一下ALE是当时建立的初衷就是跟云中讲的一样就是我们怎么样把vibe coding迅速发展的这个趋势推广到vibe everything当时vibe coding为什么发展那么快就是因为当时有非常非常多的benchmark都在coding这个领域而且coding它比较容易verify它是一个确定性的rubric大家为了刷这个榜所以在coding这上面的发展非常迅猛那么用同样的思路我们如果在其他的各个领域上尤其是工程能够客观打分的这些领域上
能够建立各种各样的这样评测体系你去刷分但你只要刷的是有益的分是有益的体那它模型带来的提升对于人的日常工作来说就是实打实的提升所以这就是我们当时想建立一个这样的初衷当然世界上大家职业各式各样实在是太多了耗如烟海所以我们只是说在第一个版本里面给出了一个相对来说覆盖面比较广的初次的一个尝试然后我们还会继续努力希望把这个覆盖的更广一些到某一天希望它能成为真正的last exam就当你解决这个benchmark的时候这本来就能解决人类社会在某些领域的真正的有益的问题
我同意EU的观点各个领域的凶点肯定是远远没有到头的然后很多东西都可能还没有被rubric的方式表征出来所以这里面还有很大的空间可能我刚刚说rubric到头了更多的是个行业趋势吧就这种静态的单轮或者多轮聊天出一个文本然后用rubric来检查它就是纯知识类的甚至也不是说到头了因为毕竟还有不同的lab每家的水平都不一样只是说今年的一个大趋势是在做这个coding然后coding逐渐转向了analogy work大家要动手了就是纯这种文本的rubric我看到需求量小了一点但还是很大还是有很多东西没解决就云中高在提到了对于很多这种文本身的输出就是说他这个文章写的好不好你可能有些这样打分的点但是事实上对于工程领域的一些产出其实有很多的评测我们确实发现了除非你把输入固定的特别死不然它的输出其实有非常非常多的可能性我举个例子你让它生成一个游戏甚至有些数学解法它都不是唯一的那这种情况下如果你给一个确定性的品盘就是你一定要跟你这个ground truth来对比那很多时候就会造成不一致的这个问题所以说很多时候说我们怎么样定义这个rubric让它能够兼容这种多式多案的输出其实这也是我们在构建benchmark中遇到的问题也是未来想去思考解决的一个方向稍微抛砖引预一下我的一个想法就是未来的这个发展出可能会比如说人类它对于一些好玩
好看它没有办法把它固化下来成为一个可以被量化的一个指标比如说游试好不好玩但实际上有些游试的入门教科书里其实是有各种各样的评判的方式比如说它那个奖励取权是不是平滑符合大脑的那个多巴胺的它一时一时有些有科学的指标可以去量化这个好玩和好看这个东西但我目前在现在的这benchmark上我还没有看到一个做得特别完整的公开出来的评测体系因为这个东西难度也确实非常高因为需要专家的更加更加深度的参与所以这一点我也想看看云中那边关于在数据工资里有没有看到这一个趋势或者或者是怎么去解决这一类的问题对这个问题特别好这也是每天我们在绞尽脑汁的问题其实整个rubric或者整个大模型的验证体系我觉得它整体上是有这么一个思路大家希望左脚踩右脚就是当我的模型变强了我这个验证器也变强了验证器变强了之后呢我就可以允许一些更复杂的rubric就比如说如果我是一个很弱的验证器那么我就只能写一些就是一个傻子都能看出来可以写得越来越模糊可以把更多的知识交给验证器来解决但是我觉得这里总体的一个思路还是说这个rubric加上验证这两块加起来的这个知识和能力应该比我要训练的模型要多不然就达不到训练模型的目的了嘛那么就回到比如说像是这种说video game这种特别特别主观的东西对吧我觉得未来可能是这样的你可能很难把它以很显示的条件一条一条写下来一个好的游戏是怎么样的那它可能有多种这样的可能所以这个时候我的rubric就会被迫写得更加模糊这个东西就by the way其实不是我们想要的就通常来说我们会建议这个rubric写得越严谨越好但是在某一些领域你可能就必须要写得很模糊这个时候需要验证的模型来自己做一些主观的判断那这个验证的模型我觉得甚至有可能是我要训练一个这个reward model我知道比如说在不少lab里面就大概这不是客户透露给我们的东西是我自己的一些经验比如说生图生图它有两个部分
follow你有没有遵循我的这个要求比如说我图里面有猫有狗有一个背景版写了哪几个字这个时候呢我是会有rubric我就写这里要有一只猫那有一只狗甚至我跑一下OCR把那个字提出来然后看看是不是我想要的那几个字就这一块是属于rubric但是还有一块呢就是说这个字要写得好这个猫要是一只可爱的猫这种东西呢就是我可以写成rubric但它非常主观就结合在一起大概率这个问题如果要解决的话可能是这么一个混合的方向因为我们刚好把rubric和环境这两个事情好像是放在对立面来说的但是听起来一他们是可以结合在一起使用的二有没有一些任务是用rubric来做会比较好的或者用环境来做比较好的我觉得这个肯定是不能拆开来讲的环境或者说任务数据它只是一个执行的基准但是rubric是最终用来打分用来奖励模型做的好还是不好所以它肯定是相辅相成又必须结合在一起来看的希望去从一个任务分类的一个角度去看而且人和agent这两个角色如何去合作它分别担任一个什么角色这也很重要我们从历史上来看就是从最早是vibcode刚出来的时候就大家用cursor其实就是一个人类也是参与在执行这个代码当中的agent它只负责执行很小的一个模块的一些写代码但后来随着agent能力越来越强agent就你给它一个非常模糊的值它能够完成一个非常大的一个project的时候那这个时候人和agent的角色又产生了一些变化大致分成这两类就是人负责决策agent负责执行人把你决策的东西说得越清楚agent就能做得更好基于这两个分类我们来看rubric该如何去设计如果我们需要agent参与的角色它只是执行就你如果把一个任务说得很清楚它的输出基本上是固定的唯一性的那这个东西rubric它就是一个确定性的rubric它打分的话就是完全可以基于一个你自己做出来的一个成品来进行打分因为一般会有ground true基准数如果我们咱们讨论未来数据需要一些就是当人的
这个决策的这部分会不会也被agent所慢慢去取代那这一部分就是我就会回到之前云中说的大家现在反而没太重视这些rubric因为决策很多是非常模糊很难去量化而且云中说你对于一个具体的domain猫可不可爱你可以train一个这样的verifier但是对于一个尤其是一个上市公司一个领导层的一个决策你该如何去train一个reward的它每天的那个任务都在变你很难去收集到足够的数据让你来训练出这样一个reward model来替你做这样的决策所以我个人认为在这一块的模型的发展还有很长的路需要去走而且这可能是会成为一个未来发展趋势这里我特别同意就比如ALE的这个方案我觉得就是面向未来比如说像这个猫可不可爱比如说我要是在这个mata我有一些用户行为的反馈我可以训练这个模型但是公司的决策我就很难收到这些数据了比如说像ALE这种就让大家把以往做过的东西还有决策交起来其实是一个方案我会觉得以后收数据可能是大家怎么样找到好的积累方式让大家把一些重要的东西交出来,尽量地能够回溯当时这些重要的决策。
非常有意思,我想再追溯一下评测的近几年的整个一个发展,然后以及它和卖数据之间的关系,因为其实我和两位私下都聊过就是卖benchmark和卖数据这两件事情,大家都觉得不能混为一谈嘛。Skill之前推出了Humanities Last Exam,就HLE这个评测,能不能给我们讲一下这个评测,然后以及你觉得它和数据之间是怎么样联系起来的?这是个好问题,我觉得从原理上来说,评测它体现的是模型距离我们想要的理想状态中间的这个gap,就是它更多的是一个科学研究这么一个基准,就是我想要模型在哪,它现在没到哪。
但是这个事情跟卖数据联系起来呢也比较有意思,因为很多时候它提升这个模型能力的数据和它榜单的评测方式是息息相关的,这里面可能比较难的是找到一个平衡,如果我就生产大量的跟这个榜单差不多的数据,那么它可能就在benchmarking,但是呢就是这个大模型训练还是有各种各样的维度,确实如果我想要提升某一类的能力,我需要抓住某一个维度,那么就是说它跟benchmark肯定是有一定的相关性,
这个是大家需要找到的一个平衡,因为大家对AGI的期待太高了,觉得人能做到的事情它都能做到,那么就是说我在各种各样的领域都可以想到一些方式,构造一个benchmark,然后发现它这个模型具体理想象当中还有一些差距,通常构造这个benchmark的人呢,对于这一块的领域可能认识比较深,那么就自然会给他一定卖数据的权威性,大家会比较相信你手上卖的数据,这个生意就这么产生了,我相信EU应该也,就ALE现在做着火的benchmark应该也有不少人,想问你卖不卖数据啊,或者是有可能VC想找你投资,结果逐渐渐的就成了一个生意,我觉得就是也有好有坏吧,就是说这个生态其实也还比较野蛮发展,有多少是在做科学,多少在做benchmarking,我觉得确实需要仔细权衡一下,但是这确实有很多的这个利益驱动,所以现在是个挺繁荣的市场,对,这里的话我也是要给他再敲个警钟,因为云中提到了现在做benchmark的人会受到各种各样的诱惑,就是要去把benchmark数据去卖了,我甚至我私下听到是有些数据公司他踩了这个红线,就是他把自己在做评测的数据去卖,当然这个是大家千万不能碰一条线,不能让你做的生意,然后污染你这个benchmark的权威性,不然的话你不仅毁了你的benchmark,也毁了其他人的模型,我个人认为benchmark和卖数据这两个东西,角色是不一样的,在这个生态系统的地位上面,
我就认为benchmark面向的是未来,做数据面向的是现在,benchmark是面向于未来,大家还希望这个模型公司去解决什么,目前还没有解决的什么问题,这是AOE,其实我们在今年1月份2月份做的时候,我们特别害怕benchmark做得太难,导致这个benchmark失去意义,因为当时的模型,很多基本上平均分只有10%到20%,大部分题目它都只有拿到0分,我们很担心这样的评测它会失去意义,但事实上没有必要担心这个事情,因为benchmark本身就是要面向于未来的模型去做的,
数据的话更多是去解决这个benchmark所产生的一些需求,所以说更说现在大家在刷这个榜单,然后怎么样去把这东西做好,我认为benchmark maxing它有好有坏,你只要面向的它这个数据,它不是直接误染于这个benchmark,然后你这个benchmark刷的又是有意义的一个榜单,只要这个benchmark和人的真实用户的体验非常接近,我觉得这个benchmark它不一定是一个贬义词,对,benchmark这件事其实特别有意思,因为一方面我们确实需要一个评测的基准,然后另一方面你又不需要模型公司为了刷评测而去刷评测,我觉得这里很自然就产生一个问题,就是什么样的评测才是有意义的评测呢,因为我们现在一周就感觉可以看到很多新的benchmark,比如说从模型公司的角度来说,他们应该怎么样去选去刷哪些评测,或者把哪些评测作为他们下一步提升模型能力的目标,然后从你们供应商还有research的角度来看,你是怎么样去看待这件事情的?
我觉得做模型能力提升最大的ROI,还是我要放在能力上,这些能力提升了,它应该是汇集各个benchmark,当然就可能有些人有不同观点,因为就对于一些模型厂商来说应用也非常重要,就比如说如果我的这个benchmark是比较贴近一个应用场景,他们其实有动机就把这个场景做好,对他们也是有意义的,最有意义的事情是大家至少口头上还是奔着AGI去的嘛,那我应该考虑哪一些核心的这个认知能力是我需要提高的,那么它体现在benchmark上就是说我可以看到一些泛化性,如果我做了一个提高,它只涨这个别的都不涨,那么可能有一些不好,所以就回到一开始的问题,未必是说怎样的一个benchmark是最好的,而是说不同的benchmark它测试了不同的东西,我可能要关注的是哪一些这共同的能力,能够让他们一起提升,而不是说我只专注于优化同一个benchmark,另外再回到benchmark本身的问题,我倒是觉得除此之外,大家确实会关心一些贴近场景的benchmark,如果这些场景是大家在意的,它确实反映了这个用户体验,这也是个好benchmark,它未必是那么universal,未必是那么大的朝着AGI去的,
但是它就确实体现了大家的体验吧,在这个角度上来说呢,那benchmark肯定是有千奇百怪的,你总会找到一个场景,我觉得可能是两个要素,就是说这个场景的这个gap,它是不是体现了一个非常具体的能力的缺陷,如果只是因为这一个场景,一些场景知识不太懂,同时这个场景又不太重要,就是我在一个机脚gala里面,我解了一个什么很奇怪的致力题,出了一个benchmark,这个能力提升了,未必代表这个模型本身的认知能力提升了,那么可能就不是一个好的benchmark,另外一块就是说,就算不反映核心的能力,它至少反映一个大家在意的场景,比如说现在特别火的是personal assistant,就是这个muse,这是一个很具体的场景,大家都希望有这么一个东西,那么这个benchmark,它甚至未必测的是模型本身,它可能还测了你的harness,最后这个benchmark,它甚至不是为了卖模型的训练数据,而是告诉你我的harness错在哪,可能我可以做些工程油画,就是贴近大家需求场景的benchmark,也是好的benchmark,所以在我看来,一个是反映了核心的认知能力,一种是贴合场景,当然两个都有的话是最好的,我觉得最重要,现在大模型公司很看重的一个,就是benchmark的分布,大家应该可能都听说过,artificial analysis这个评测体系,
他们其实做的事情很简单,就是把各家benchmark给不同的权重,然后把它综合到一起来,得到一个分数,但这样它就存在一个问题,它这个分布的权重,是不是真的是大伙需要的权重,然后权重以什么方式去进行迭代,
这个都是挺主观的一个事情,大家质疑的更多不是这个模型本身,而是质疑这个榜单本身,我现在倾向于认为,
大家可能benchmark还不够好,做到大家心目中要了distribution的那种级别,很难达到一个grunt choice,所以现在很厉害的模型厂商,比如anthropic或者obian,他们都会倾向于去自建一个评测体系,来让它更接近他们心目中的分布,只不过第三方的知证,可以让他们对外发布的时候更有说服力一些,当然比如说云中说的一个垂直领域的,肯定是非常重要的,因为这个就是面下一类群体,它这个分布就是那个群体需要每天在做的事情,如果他能把那个分刷高,比如金融啊,法律,他们律师每天做的事情,能把那个做扎实的,那他们法律只需要看这一个benchmark就足够了,第二点就是云中提到了,有些benchmark它并不能代表真实的人生,比如说之前有一些benchmark它是测agent智力的,就是玩那种小游戏,那种arc challenge那种游戏,对,arc 2,arc 3这种,对,是,它这个benchmark的书中是说,觉得能解这些游戏是人类的一个智力的体现,但是没想到,就这个智力其实也是可以做的特别特化,我一个小模型也能把它搞出来,还挺有意思的,那有没有什么特别niche的benchmark,但是可能大众不太了解,但其实是非常有用的测试这个模型能力的例子,我可以举个我们的例子,我们有一些benchmark可能不太经常出现在大家的榜单上,比如说我们前一阵子做的drug discovery,还有一个跟AI tutor相关的,它可能关心的是一个比较小的垂直领域,但是跟我和各lab的交流,负责相关领域的团队,
他们通常就会有这么一个人,他们会看市面上跟他领域相关的评测,他都会把它收回来,然后另外一个就是说这个benchmark最后上不上榜单,火不火,其实也有很多随机因素,比如说AA就有一个很好玩的事,AA用了我们做的一个榜单叫Sweet Atlas,我们当时是做了几个不同风味的SweetTest,其中有Q&A就是代码仓库问答,还有代码重构,还有写Test,只不过我们是分三个阶段退出的,
所以Q&A先退出了,退出之后我们还没来得及,把另外两个退出,把它们合在一起,然后somehow那个Q&A就先被AA减去了,Q&A上了AA之后,大家就开始site这个东西,突然间就这一块需求就变大了,我们当时想的很不理解,Q&A是最简单的一个场景,就是我们花了那么多心血,做了更复杂的benchmark,结果就是因为可能是时间关系,还有的时候是某一个lab用了,可能是碰巧它的分号,这里面其实是有一些随机因素,就是你在这个榜单上,就大家tech report上看的东西呢,有一定随机性,AA收这些榜单有一些随机性,最后就是你没看到的东西,其实背后可能也有人在用,就这个生态其实水还比较深,还比较复杂一点,明白,一由其实我还想再问一下,就你刚才提到的,大家对于artificial analysis这样榜单的质疑,然后你觉得说是不接近于大家理想中的分布,这个分布现在有没有一个共识呢,因为我理解每个模型公司对于分布的需求,其实也是不太一样的,是吧,如果是在这种情况下的话,我们怎么样去理解这个理想状态下的分布,它是应该比较接近真实世界的这样一些任务,
还是说是别的分布?我觉得真实的分布,其实本质上就是大家的用户体验,就是世界上假设说存在这样一个ground truth,就真实的分布的真实的打分,其实有点类似于LM Arena这种模式,假设说你每天prompt这个agent的时候,你能够有多条模型一直在执行,然后给他们打分,这是最真实的评价,但是这个现实生活中能够做到这样的榜单,有那么以下这种因素,
LM Arena之前做好,是因为之前的QA它这个很快,它开销很低,你给他一个问题,他能够几秒钟之内给你个答案,你很快就能进行打分。但现在在agent的时代,一个长程任务动辄几个小时,一个用户也没有那么多的超能力,每次执行一个任务都连着开几个agent的一起去执行。然后也没有个机制去反馈把它收集起来。所以说大家的评价很多都是一个偏主观的,它很难拿到这样一个真正的ground truth。但如果说有哪家公司或者有哪家由某种方式解决了这个问题,那肯定很厉害。但我相信他们大模型公司内部肯定是有这样一个机制的。
就是让它有几个版本的模型,然后有一些用户他是真实用了这个东西,然后去测。我的意思是假设有这样一个distribution,然后你这个评测的分数的分布接近于这个东西,那它就是一个很好的benchmark。对,我听到一些比较有意思的,很多评测benchmark跟我线上做AB test测出来结果是不一样的。就是用户的反馈跟评测其实有时候不太一样,甚至很难说哪个好,因为用户有时候也比较主观嘛。
像这种聊天的,对吧,你可能给他特别多这种factual的东西,versus给他很多这种clickbait,就说他爱听的话,可能这个结果也不一样。所以这块还是挺复杂的。对,是这样的。就像Cloud Code,我觉得在AreaMna上分数一直聊聊聊聊天,就是因为我觉得Cloud Code它有个特点,就是尤其中文用户或者英文用户,它给出来的这个output format更贴近于人们心目中想看到的,就非常容易去理解。相反的,Codex它可能执行得更细致一些,但是输出的东西就没有那么人那么容易去,相对的没那么理解,所以说稍微吃了点亏。
但我个人体验用户下来,他们两个可能是不相上下,其实我个人还更偏好于OpenAI那边一点,因为它做的更细致,犯的错误更少。所以这个确实也是很主观的一个事情,去怎么定义好这个disperimentation。所以在这种情况下,模型公司还会把Benchmark视为判断自己模型能力的一个标准吗?他们肯定也是在乎外部的评价,不同模型公司,我说说先说美国那家大的,他们肯定是倾向于自建为主,就是自家的evaluation团队,因为他们有这个能力去建。但是对于一些比如说刚成立的,或者相对没有那么有名气的一些frontier labs,或者它不是头部的frontier labs,他们肯定是会非常依赖于外部的评测。
因为它内部的评测团队可能没有那么有经验,或者那么完善,或者说他们的人力资源更希望投入到模型的训练和开发当中,而不是去直接利用。
所以这个每个公司的测试都不太一样。其实我的个人判断是说,当一个产品逐渐成熟之后,或者当你积累了一定体量的用户之后,最后你其实关心的还是用户增长。比如说我之前其实做了很多年,在Meta做搜索跟推荐,逐渐的就变成了一个类似搜索推荐的问题,就你看什么样的指标跟用户增长最相关。
最后就是朝着赚钱的方向走的。
现在可能真正能够评测到这个能力的lab不太多,需要一定的用户体量,可能在这个聊天的场景就比较成熟了。但是在这些agent的场景上,能做到这个程度就更复杂一点。大模型可能跟传统这个搜推不太一样的地方就在于说它的场景很复杂。就算我能够在这个chat场景做好很好的这个abtest,甚至选这个reward model来朝用户喜欢的方向发展,我总会有新的东西出来。而且大家一直在看新的东西,比如说现在大家都在卷这个科学发现。科学发现我不可能有足够量的科学家给我显著的abtest的结果。
必须还是要依靠场景构造benchmark。我会说因为大家对这里的这个应用场景的期待太高了,场景增长的速度赶不上我在这个领域用户沉淀的速度。还是有大量的需求,要依靠这个benchmark来做评价标准。但我会觉得在某一些领域沉淀下来之后,大家会有更多的线上的评测体系,然后可能会像这种传统的互联网增长,看看哪些指标跟用户的DAU增长跟相关。
对,能不能深入讲一下数据采购这件事情,我觉得就是有几个点非常有意思。第一,你提到了刚才有很多小的公司,其实是现在一个创业机会嘛。这也是为什么我们看到很多最近兴起的一些四五个人,甚至两三个人的这些数据创业公司拿到了非常高的估值。这是不是就是因为他们的目标就是这些非常垂直的领域的数据?
对,我觉得这里可能有几块问题。首先,我觉得最近兴起的这些RO Environment公司呢,其实更多的是在做合成。因为整个数据行业已经从找人标注慢慢的过渡,你要交付的是一整套环境。然后这个环境可能需要大量的这个工程工作在里面。很多在这些合成的技术站上做的比较好的一个小团队呢,其实可以比较短的时间交付大量的合成环境。这些未必是不好的,就合成它有时候你也可以基于一些长的模型,或者说基于一些半成品的这些artifact,是可以做出一些好东西来的。现在这里是一块增长。
但是再往下走呢,这里面比较有意思的就是说,这个东西之所以能成立。因为大家今年的主题是在卷代码。软件行业是最奇怪的一个,就它非常的open,有大量的公开资料。而且就是我们生产数据的公司同时大家都懂代码。
所以就这个比较好解决,让一些小的团队有很多机会可以自己造很多数据。但是我觉得再往后面走,比如说这些其他领域的锤类就更复杂了。这里面我会看到了有一些公司,他们可能解决两个不同的问题。比如说像我们做后训练数据,其实在我看来是两个问题。第一是采购,就是我把原材料买回来,就好像ALE让大家上传,对吧?
这是一个比较新的机力机制。然后加工,加工就是我们再把它标注,或者是通过一些agent pipeline把它做成适合大模型训练的环境。在垂直领域问题上,其实采购变得越来越复杂。就甚至代码领域,其实采购一些私域的代码仓库,谁能把这个问题解决好,其实就是一个巨大的优势。那么在垂直行业,比如说我如果是做芯片设计的,我可能要把整个芯片设计的环境给造出来,可能当中涉及到一些商业软件。那我怎么样把这些商业软件的版权拿到,把它包在这里面,就是一个问题。
还有一个就比如说做DevOps,我要是一个系统工程师,我要操作什么AWS之类的。
然后我之后有个公司做了一整套AWS模拟器。每一个锤类的这个环境都有一些很深的东西,你可能要采购,可能要定制软件。大家抓住一两个锤类,把这个东西做好,其实创造了很多新的机会。明白,因为刚才我们提到这些垂直场景,比如说在drug discovery,这些生物医药方面的,还有一些具体行业的评测下面,我们可能没有足够的场景,或者没有足够的好的评测。在这种情况下,我们有足够的好的数据吗?这里其实有一个难点,每个领域它是需要一些人把它的专业知识吐出来之外呢,
我还要需要这个领域的这个东西。像邀无发现,然后可能需要很多,也是私有的数据库。就这里面我觉得是目前这个行业一个大的卡点,就是你先要能把这东西买到,你知道大家手上有什么,才能把它做成benchmark。
ALE其实很大程度上是在解决这个问题。对,ALE就是希望大家能够以中包的方式,让专家把自己做过的project交上来。当然这里面有一些不符合规范的,我们都筛掉了,因为他们甚至把一些非常非常撕的东西都交上来了,比如说什么法院的一些证据什么,就是非常,对,然后我们尽量把这个都筛掉了。
比如说我们现在在V2中,我们也尝试去收一些数据,
比如说Steam上的一个游戏库,就游戏开发的一个任务,它一个那种名不见经转的一个大概几千人铁量的一个mobile的游戏,它要价能要到两三百万人民币一条。我觉得哪家数据公司或者Benzu,Benchmark都没有这个财力去做这个事情。就是这个游戏公司会要价要到两三百万一条?
对,要这个游戏的圆码,对。就比如说很多公司想要采一些游戏的视频,然后做一些标注,游戏的视频可能是版权数据。这里有一个巨大的采购问题,我觉得这里是一个商业集会。我现在其实看到不少startup在解决这些问题,
就在大的数上我们自己也在投入做一些采购方面的工作。但是总体上来说,我觉得这里很有巨大的问题没有被解决。有哪些现在非常热门的锤类是数据非常少的?
我会说至少医疗算一个,就是数据比较敏感。就是谁能拿到大量的病例数据,那就非常有优势。对,因为其实也有很多新闻讲到说可能在法律或者金融的这些领域会有一些之前离职的员工可能会去分享他们的工作流。不过可能工作流数据和像医疗数据里面这些病人的data还是不太一样。
是的,各个领域。我觉得甚至现在大家之所以都在说金融、医疗,其实因为跟大家比较息息相关吧,大家多少还懂一点。其实这个世界上有很多我都不知道的行业,
就是你真的要跟他们聊才知道。就比如说我才知道就做这个药物研发,大家还会交易这些分子,一个分子还能倒腾几套,这里面还要做滴滴。所以可能没有做只是因为大家不知道。对,就是我们在做ALA-V2想要把比如说一个领域做生的时候,我们会尝试先捋一个领域它会有哪些工作流,会有一个树状这样的结构。尤其在生物学这一方面,然后我们至于Nature这个publication它会有自然的分类,它对于子学科分类,然后把这个树展开到第三级的时候,大概有3000个节点。
然后我们也做了一下工作,就是把现在已有的市面上的Life和Bio的这个Benchmark已经覆盖了多少,做了一个统计,大概是可能10%,5%都不到。现在它连一个成型就是覆盖面完全的一个Benchmark市面上都没有,更别说是针对这个去做相应的数据。明白,那像我们刚刚提到了这些做合成数据的小公司,他们能赚钱的周期有多长呢?因为听起来好像都是这几年新出现的这样一些公司,这些数据它的生命周期有多长呢?这是个好问题,至少现在需求还是挺大的,然后未来可能说比如说这一波coding就要完了,那么他们需要新的品类,大家你能不能抓住下一个机会,而且下一个机会可能跟你现在的运行模式不太一样,比如说我自己也会觉得采购会很重要,那么采购能力比较差的可能就比较难,或者就像EU他们,你可能有些新的激励机制,让大家把东西交进来,所以可能以前的一个激励机制是招聘平台,或者就给你一个小时工,但是以后可能有新的激励机制,就是谁能把这些东西玩了转,可能会继续有一些优势。
这个地方我想问一遍众你的看法,因为我个人认为随着模型能力越来越强,模型公司自己内部创造数据的能力也越来越强,这一点你认为这个饼是越来越大的,但有没有可能会出现一个情况,这个饼面向于非头部公司的这个机会,反而是门槛是越来越高的,入场圈是越来越大。就是数学这块领域。之前的话大家只是要去影印那些奥数课本,就能够去评量造出大量数字。但这些数据现在基本上是零价值。所以你是怎么看待这个趋势,就未来的数据公司的这个发展方向。
我会觉得从第一性原则上来说,还有巨量的问题没有解决。你要想这个世界上还有多少东西没被蒸馏干净,是巨大的机会。但是如果你就看现在大家是怎么运行的,这个事情当然会越来越难。因为越来越多的这个玩家进来了。我觉得大家如果只盯着我手上的工作,这个一定是越来越难做的。就算这个Labs不自己做,越来越多竞争对手进来,你的margin也会越来越低。所以在我看来一个好的书商其实最后解决的是个研发问题了。就好像一个软件公司一样,我要提前投入未来大家需要的东西。赚到钱之后再投入下一个东西。
在Labs本身呢,我有个暴论,可能Labs未必有最好的基因来解决数据的问题。这里面可能有几块,比如说合生数据。
合生数据其实按理说很多就是这个Lab Research的本职工作了。尤其是搞后训练的,大部分时间都在挖在搞数据上。就是买数据,核数据,验证数据,洗数据。但是这个领域你会觉得为什么外面的人会有机会呢?
Somehow今年的这一波增长都来自于一些懂行的人在外面把这个数据合了,再卖回去。所以这个事情是存在的。我觉得一方面是因为大模型公司现在有太多的钱,就是你自己造外面买,其实也不矛盾。但是在更长远上来说呢,其实有很多问题可能模型公司没有太好的基因解决。
比如说如果我要采购,我要把一些行业的东西先采购回来,蒸馏出来。这个时候我会觉得大的Lab可能未必有那么大的优势,它甚至可能会有一些conflict of interest。比如说一方面把你的这个FDE派到了人家企业里面,然后另一方面你有一拨人在搞这个企业数据。那么我会觉得如果我是一个企业,我是不太放心把我的数据交给你的。出于这些原因,有一些东西可能Lab不太适合自己做。它可能还是需要第三方的这个人帮他做一些采购,或者深入到一些行业领域里面去。
我会觉得一个树上真正要做的事情是研发,看看未来还有哪些行业是重要的。这些行业有哪些东西我要值得投入,把东西买回来。然后我自己先投入R&D,把这个行业的问题给研究清楚,然后再把它做成benchmark,或者做成数据,甚至证明这个东西有效性。然后我再择手买给Lab。从Lab来说呢,就是大家的这个deadline都很死。
如果我是一个Lab的research,如果你让我花半年的时间来解决一个行业,可能有时候大家其实没有自由度。就是这个时候你看到,那边有一个树商说,我把那个行业的东西搞清楚了,你要不要,大家通常都会看一眼。所以我觉得其实长期来说拼的还是一个研发能力。你觉得这个趋势对于大模型公司来说会持续吗?因为现在模型公司里面也有自己的数据团队嘛,但是你觉得他们更愿意去从第三方那里收数据,而不是自己去造环境造数据。这里我觉得可能不矛盾吧,因为最后模型公司最高的优先级还是把东西做好。
如果他们自己能生产好的数据的话,有可能会倾向于自己生产。只是现在大方向上来看,这个世界上还有太多的这个工作流没有被彻腾清楚了。那么对外部树商的依赖,我觉得是长期存在的。甚至就是一个大模型实验室自己可能未必想要投入那么多的资源,做得这么重。可能更prefered灵活一点。缺点就是说大家可能希望更多的东西是第一方的,不希望所有人都能从树商中获得这些能力。所以就从这个角度来看,会有一定的动机自己研发。
然后就比如说现在可能很多labs它在做这个expert matching,就是说你把人拍到我这里来,就也有这么一些趋势。我自己也会觉得说现在有太多东西没有被解决了。不管是谁把这些问题解决了,那他一定是有赚钱的机会。这个东西可能跟在哪里发生不是很有所谓。现在是机会多,比你再变大的这么一个阶段。
但这也是大家对于数据一直有一个问题,也就是说如果一个第三方供应商把同样的数据卖给不同的模型公司,那它中间怎么样去区分呢?这里通常来说有个比较简单的解决方案。就是说你可以花多点钱把这个数据买断。你觉得对于模型公司来说,在数据供应商收到那么多数据的情况下,他们怎么样去使用这些数据?这个流程能不能给我们讲一下。这里面一般来说它是有一些比较固定的训练方式的,我们把它叫training recipe。
比如说像是比较简单的这种数据,可能就是直接SFT,就是我把对的答案给他就行了。然后像是rubric这种,他可能就是在做强化学习,因为就是不停的有一个模型在给他打分。比较有意思的是现在这些RL环境,比如说最近大家在卷的一些特别长省的人物。现在今年的一个主题是RNSI,就是Recursive Cell Improvement。它其实是个Buzzword,就是说AI自己研发自己。大家最近就在看那些,我跑一把,可能要跑个几天一个星期,其中你可能要有个GPU,真的在上面模型训模型的任务。
这里的训练方式其实就开始变得有一些模糊了。我们也在一起研究这里面的训练方式要怎么搞。但是我自己就觉得这里面其实还没有太多的共识,所以还有很多有意思的空间。就对于树商来说,有时候也不完全是就造一个模拟的task这么简单,你还要考虑到它模型公司拿去要怎么训。
然后针对它怎么训,可能还要有一些定制。对,这一块我也比较好奇。如果说你就是为了BenchMax,就是你拿ALE的一些任务,你直接去训练。
就类似做一批这样的数据。那你怎么保证这个数据它训练出来,它模型能力,泛化能力是能够提升,能够被迁移到其他的任务上去。然后这个东西有没有一些比较视同化的,科学化的方法来做这样的验证呢?如何在不train一个模型之处上,然后能够评判这个数据,能给模型带来怎样的提升。
对,我觉得这里其实有一些技术。比如说现在如果我要造一个环境,大家最怕的就是reward hack,就是它有捷径。如果明明我没有完成这个task,我可能是做使了一些手脚,结果somehow我的这个分可以打得很高。就是我迅速来这个模型肯定会变成一个耍滑头模型。这种东西肯定是不希望发生的。那么通常来说会有一些技术,我可以用agent来做这个red team。就是我会让一些比较强的模型来试试看,能不能在这个task里面找到捷径。
另外就是这里面很多是我自己的个人猜想,就不代表scale AI或者任何客户。就是说在训练这些东西的时候,很多benchmark我们可能只关心最后有没有完成这个任务。就是我们验证器是围绕这些东西设计的。
但是我怎么样完成它,这些东西可能也会在模型训练里面有一些关键作用。一个比较trivial的例子就是说budget。就比如说我训模型的时候,我会关心它是不是消耗了过多的token或者用了这些部署。那么我们在训练它,比如说在拿NLE的模型数据训练的时候,肯定我最后reward会很复杂,不是说我把它这种一解出来就行了,我可能还关注它消耗了多少资源。
最后可能是在各种各样维度的检查reward,防止它作弊这些东西结合起来,才能完成一个训练的recipe。其实就感觉也没那么简单。这些可能是训练数据更多要考虑的问题,就是说我这些数据能不能导出一个比较好的训练方式。能不能讲一下像RSI,或者就因为刚才我们也提到很多NeoLab嘛,像在这些情况下,做这些训练需要的数据有什么不一样吗?
或者需要的定制有什么不一样吗?通常来说最常见的定制其实是难度。大家做benchmark的时候一般来说,至少希望它不那么饱和,那就意味着越难越好,但也不一定,比如说的也不要,就完全解不出来。就是benchmark的难度更多的是一个客观的,反映我这个行业难度的事情。但是在我续模型的时候需要做一个特化,就是说这个难度对它的模型要是适中的,我们有时候会做这个事情,
模型厂商会把它甚至还没有发布的这个模型给我们,然后我们帮它筛数据。这个题目对它来说不能太难,也不能太简单,因为现在做这个强化学习是说,让模型在上面自己试,如果试对了的话,它就能学到一些东西,那我给它题太难了,它啥也做不出来,肯定就不行。所以在这个难度上会做一些适配。然后另外可能我们会做一些轨迹采集,就比如说如果你把你的模型的轨迹给我们,我们可能把这些轨迹采集出来,然后帮你做一些筛选。甚至我们想办法用人给你搞一些,可以解这些问题的轨迹,这样你可以拿回去,不需要做强化学习,你可以直接造这个轨迹做SFT。
针对它的这个训练需求,其实也有一些特化的这种工作。OK,接下来还想再聊一下数据污染的这个问题,因为今年二月的时候呢,OpenAI就宣布停止报告它在SWE Bench Verify里面的分数。这个其实也是一套评测啊,那具体来说呢,就是让AI修复真实开源软件里面的项目问题,再通过这个测试来判断它有没有修好。当时呢,
OpenAI主要是指出了两类问题,一类是它测试本身可能会有缺陷,比如说有的功能上正确的解法也会被判错。另一类呢,就是数据污染,这个我觉得很有意思啊,他们发现是在特定提示下面,模型能够复现部分题目原本的人类修复代码,也就是说呢,模型很可能在训练过程当中就已经接触过相关内容了,所以这个分数就变得有点难解释了。
我想问一下两位是怎么理解数据污染这个问题的呢?就SwipBank这一类数据其实有一个问题,它可能甚至还不是污染,就是它Task可能就做得不够好,就比如说有时候有一些错误是假错误,就比如说可能我的测试脚本要求的太多了,
或者是我的Task没讲清楚,
有这么一些类型的原因吧。另外一个污染可能是说,模型域训练的时候把这些东西都训练进去了,这里面其实是有一些技术可以检测到这些东西,
我想ALE上面应该会有一些这种经验。要不然它说不采用SwipBank,它是连SwipBank Verified也不采用。就是当一个Benchmark,我印象中它是在过去的六个月内只从74%提升到80%,然后剩下的一些问题可能是脚本写得太Hush了,或者它的题目本身就是不可解,或者是会有各种各样的问题。它剩下的可能20%都是指约在这个问题上,那这个编制码本身可能就失去了它对比的意义。ALE也没有解决一个问题,这个也想跟云伦探讨一下。就当一个专家他本身提交上来的材料本身是错的时候,我该如何去预防这个问题?
这个是我们真实发生过的,因为我们专家这个五花八门了,当然这个这样的人很少,他是为了提交这个任务,然后为了拿到作者,因为我们的奖励机制就是你提交了这个东西,然后我们接纳了你这个任务,你就能被纳为作者列表的一部分。
确实是有人为了提交而提交,然后他甚至是持了agent去合成一堆乱七八糟的数据,甚至有些数据交上来,我肉眼看出来他就是颠的。这个东西是确实对我们工作造成了很大的困扰。这是一个特别大的问题,scale总是有人,总是可以靠人解决的。
这里有个特别有意思的问题,比如说EU提到了,我给他这个authorship是一种奖励机制,那他会带我一定的问题。比如说scale更原始的,比如说我就给你小时工,那大家也有一些同意,偷懒作弊的方案。我会觉得这个奖励机制是个特别特别难的问题。长远来说,比如说我的目标是把人类都蒸留干净,对吧?
怎么样设计一个好的奖励机制,把大家的目标都align。我觉得这里其实有特别大的空间,这里可能是个巨大的research area。我自己心中可能有一些方案。Proof of Work,就比如说我要求你把做这个东西的一整段,工作流程全部都录下来,你必须要做到多少时长,或者怎么样。不同形式的问题,它有不同形式的奖励和验证机制。
这里面其实有很多玩法,值得大家探索。这里面其实也涉及了一个更大的问题,就是很多数据它本来也就是公开数据嘛,就是网上的一些资料啊,公开代码啊,这些东西。所以这些数据是不是本身就注定了会有污染?一般是怎么样处理这些情况?其实最简单的污染,你直接其实问agent,它都能找到。
公开数据其实还好检测,我觉得最难的是编造数据。比如说让你去做一个化学模拟,就它根本就没有跑过这个任务,它自己编了一套似是而非的东西,你没有个几个月根本查不出来这个问题,因为它看上去很真。
什么时候能发现这个问题?
当所有的agent,它的能力只不让远超这个问题本身的时候,它发现所有的答案它们都是做出来是一样的,但是跟这个真实答案是不一致的。这个时候我们就会查出问题,但这个周期会非常长。但是你让另外一个专家去验证这个问题,它成本又非常非常高。因为它本身这个问题,它都是要专家化一个多礼拜,或者两个礼拜才能做出来。
对,然后那个验证的专家,你要保证它。验证的专家,它本身也会为了一些东西,偷奸耍耍耍,说这个东西,它就是对的。所以每个涉及到专家评测都会有这个问题吗?对,都会有。众包的benchmark为什么难做?就是难做在这里,人性是非常复杂的。是,我觉得这里它可能甚至验证是一环,我自己觉得确实在奖励机制上。
比如说,如果你就让它在那老老实实待着做12个小时,对吧,就你给我合下假数据,你也要把每一步都给我交出来,要求你必须做这么多的动作,那它可能就没有那么大的动机给你合假数据了。这些是比较值得研究的方向。
很有意思。其实我本来是想问一下真实工作流的数据,但是听下来大家现在还是在卷coding数据是吗?就不是在做真的workflow。因为我理解是,比如说像McCurr这样的公司,就是有在卖一些真的workflow的数据,
但是听下来coding现在还是这个赛道最卷的。其实您怎么定义真实工作流的数据?就真实工作流的数据本质上它都能够被化挥到一个coding的问题。就是说说对3D建模这个问题,其实有很多比如说FreeCAD什么,它都是提供了现成的API让你去做这个事情的。就是这不是传统意义上的coding,就是让你去写一段代码去解一个leadcode的这种coding题。它是用coding去解决真实workflow。所以说只要有足够的MCP API调用,它其实本质上95%以上的它任务都能够被化挥到coding的问题上。
对,就是可能有一些小的,
可以看它这个task本身是要的什么东西,它涉及到的一些环节是什么,能把它归结到不同领域的工作流上去。但是就我同意EU说的,现在因为你让agent来做事情,代码就是它的手跟脚嘛,所以它其实归根结底,coding肯定是其中的一环。明白。你们觉得在私有数据需求依然很大的情况下,
未来的数据公司会不会从卷采购本身变成卷并购,就是去收获一些垂直领域的公司。
对,不评论scale AI。我是听说有一块很大的private equity business,就是说以前大家是flip公司嘛,现在flip公司的一个新的方式就是说我买的这个公司,然后我用AI让它体效,把一些人裁了,之后呢把这个公司的价值做上去再把它卖了。现在就多了一层,就是除了我买这个公司,可以把它重组打包,用AI体效之外呢,我还能把它的数据发掘出来,就它数据还能卖一些钱,所以就是让这些整个买公司的行业又多了一个玩法,就很自然的,大家就是树上或者就传统做private equity的公司也在看这个数据,怎么能够卖钱,然后就兴起了一整个领域,我甚至觉得说,如果真的未来比如说五年,十年还是这个速度发展,大家还没有遇到瓶颈的话,把各个行业的东西都给拿出来,可能这个东西跟大模型本身就是世界上最大的两个行业,当然这是比较极端的,这个AI do means do you,可能会导出这么一个世界,是的,
但是听起来其实数据行业本身也是在变化的非常快,因为就像我们刚才提到从这个Rubric Data到RL环境的这样一个变化,所以有什么信号会让你觉得有某一个领域或者某一个赛道它可以持续的增长吗?
我会觉得就首先还有很多没有解决的问题,机会还是很多的,另外一方面有越来越多的玩家进来了,比如说每年都有很多新的New Lab,资本市场还是以这个方式运作的话,就这个饼是越来越大的,但是这个数据变化很快,不太像是一个我可以躺在一个地方一直吃老本的生意,树商要疯狂的迭代自己,那么最后可能是拼大家的R&D的能力,那或者说谁能把这个R&D的这个能力本身固化,做成一个flywheel,我有一个流水线可以一直在发掘新的东西,也许这个是未来最大的优势,但是就这东西上来说,我会觉得现在是百花齐放吧,未来机会还很多。
这我也是从一些地方听说,就是树商呢,它估值空间一般没有传统的这个公司来得大,就是因为它很难把这个杠杆保持住,然后让你以很轻松的方式,在一个积累的用户量情况下,就能躺在那里吃老本挣钱,就像Facebook啊,Google的一些生物研,它已经有积累大量用户,它就能躺在这些APP上赚钱,但数据深一点,领导者必须持续地去思考,下一步在哪里,持续去迭代,因为模型迭代速度太恐怖了。你觉得你们现在在做ALE2.0的时候,最难的是什么?
我觉得学术上相对容易一些的,比他们做商业商,因为他们给我们的数据很多都是无偿的,但是我能够想象得出,我如果是一家树上去搜这个数据,它这些都是天文数字,就那些搜上来的原始项目和代码,而且很难找到一个很好的奖励之制,让这些专家能够自愿地把这个交上来,我拿Mercury他们官网上的,给专家的一个小时的那个价格来说,比如说制造业的工程师,大概是可能一两百刀一个小时,这种价格就限定了,它不可能招到特别特别高级的工程师,但是为什么学术界好做,因为我们能够自然而然吸引到一些这种级别的人,来帮我们收集数据,因为他们不求钱,他们图的是大家一起把这个事情做好,图的是个名,所以说这个奖励之不一样,就导致你能吸引到的人不一样,你的上游是不一样的,OK,很有意思,好呀,那我们就到这里结束吧,谢谢云中,谢谢云游参加我们的节目,谢谢云温,谢谢,谢谢,好了,
以上就是我们这期播客的全部内容了,国内的听众可以通过小宇宙,苹果播客,网易云音乐,喜马拉雅QQ音乐,蜻蜓FM,荔枝FM来关注我们,海外的听众可以通过苹果播客和Spotify,或者在YouTube上搜索硅谷101播客来关注我们,我们部分的文字稿还会收录在硅谷101的微信公众号上,谢谢大家,我们下次再见啦,