林一舟坐在办公室里,看了坤元发布会的全程。
当然,上班时间,他也不敢太过分,把屏幕调小放在角落里,随时关注着经理那边的动静,一有风吹草动,就赶紧用代码编辑器的界面把视频挡住。
至於戴着耳机就更不是问题了。
哪个程式设计师工作的时候不带耳机的?
林一舟不是鼎盛的员工,也没买鼎盛的股票,顶多算是个用户一这还是因为公司用的是鼎盛云。
但是林一舟是个AI的狂热布道者。
在所有人都还在犹豫着要不要学一学,要不要试一试的时候,林一舟已经坚定的扑向了AI的怀抱。
虽然他自己没有人工智慧的学历背景,只是一个普通的後端开发工程师,但是他积极的关注AI行业的消息,自己花时间研究工具。
御风出来的时候,他就是第一时间去注册的。
现在鼎盛声势浩大的宣传了他们的第一款通用大模型,林一舟自然要看直播。
发布会上的效果真是惊艳,但他看多了发布会,对实际效果还有疑虑。
大厂发布会嘛,多少都得吹一点。
这放出来的部分,不知道有多少是提前设置好的,或者全是。
发布会结束,在公测连结放出来的第一时间,林一舟就去注册了。
工作上的内容肯定是不让上传,他用几个自己在ChatGPT、水星上常用的场景试了一下,很快就被坤元给折服了。
坤元是真有东西!
很快他就忍不住上网和人分享了。
【@一叶扁舟:兄弟们你们别说,这次鼎盛出息了,做出来的东西还真的好用。#坤元发布】
还附上了几个自己实际使用的例子。
一开始回复的人还不多,但是很快热度就上来了,林一舟上一次看到提示里有99+还是吐槽公司不让用御风的时候。
这次来回复的人更多,林一舟一个一个都看不过来了。
有越来越多的人在留言里发他们使用坤元模型问答的截图。
问的问题是五花八门:
有做电商运营的,把一段乱七八糟的活动复盘丢进去,坤元直接帮他提炼出了真正影响转化率的三个问题。
有做客服质检的,把一堆客户投诉记录贴进去,坤元没有像其他模型那样总结情绪,而是直接指出售後流程中哪个节点最可能造成二次投诉。
还有人把自己写的网文写进去,坤元也没有像其他的模型那样直接对这作者一顿彩虹屁,什麽「鲁迅再世,海明威第二」,而是直接锐评:你这个黄金三章不到位,回去好好想想,带给读者的爽点是什麽?
最後结论就只有一个坤元这模型也太聪明了。
下班回家之後,林一舟又打开电脑,和坤元交流了几轮,很快就达到交谈上限,被限流了。
现在API还没有开放,不然正聊的上头的林一舟可能高低得充点钱用爽了再说。
躺在床上,林一舟还在想鼎盛CEO说的那句话:「让AI听懂中国。」
牛逼啊。
带着这种想法,林一舟睡着了。
第二天一早,伴随着手机发出的闹钟铃声,林一舟迷迷糊糊的睁开眼,拿起枕头边的手机开始刷朋友圈,很快就看到了一条吸引他目光的文章。
标题是《比你聪明的人还比你卷?鼎盛坤元大模型连夜放出1.1版本》
林一舟揉了揉眼睛。
昨天开发布会,公测1.0,今天就更新1.1?这叠代的也太快了吧!大厂就是这麽卷的吗?
一会去公司了试试。
林一舟这麽想着,又躺在床上刷了半小时手机,等到第二个闹钟都响了,才拖着自己疲惫的身体起床,准备开启自己牛马的一天。
拿着路上买的豆浆油条进了公司,林一舟来到公位上,发现桌子上已经放着一份经理给的活了。
现在进行中的项目因为资源不足不得不延期,要写一个项目延期说明,和上下游的组同步。
这本来是经理的活,但是经理不干,甩给林一舟干,他也只能硬着头皮干了。
还好,有AI。
林一舟打开坤元的网页界面,果然见到昨天的模型型号1.0今天变成了1.1。
1.1自然要比1.0要好,他也不在意,直接把需求输了进去。
公司的代码不让上传到AI工具,我让他帮我写个报告,总可以吧?
很快,坤元输出了:「项目延期说明应从以下几个方面展开:
一、项目背景(对勾)
介绍项目启动背景、建设目标和当前进展。
二、延期原因(对勾)
可以从需求变化、资源协调、技术难点、测试验证等方面进行说明。
三、後续计划(对勾)
明确下一阶段工作安排、责任人和时间节点。
四、保障措施(对勾)
加强项目管理,优化沟通机制,提升协同效率,确保项目顺利推进。」
林一舟看了这个回答,一头雾水。
啊不是,我用错模型了?这回答还不如ChatGPT呢?而且你这满屏幕的emoji是怎麽回事啊?我那个善解人意、足智多谋的坤元呢?我昨天那麽大一个坤元呢?
林一舟又试了几次不同的提示词,甚至把昨天问过的相同的问题又问了一遍,输出的答案跟昨天比起来一点儿也不一样。
误?昨天的使用记录也不见了。
最後,林一舟不得不得出一个结论。
坤元1.1比坤元1.0大幅度降智了。
差距太明显了。
林一舟拿出手机,打开一个野生的AI社区交流群,发现里面已经有人在讨论这件事了。
【你们今天再试了吗?怎麽感觉变蠢了?】
【不是感觉,是真的变蠢了。】
【坤元是不是换模型了?】
【页面显示1.1了。】
【不是吧,1.0才活了一晚上?】
【我昨晚让它帮我分析一个增长方案,它直接指出设计有漏洞。今天同样的问题,它给我贴了一个万金油回复。】
最後发话的这个人发了两张截图。
昨天的坤元1.0,在看完一份团购增长方案後,第一句话就是:
【这份方案最大的问题不是增长手段不足,而是默认履约能力可以承受增长,这个前提不成立。增长越快,履约压力越大,用屍体验越差,反而会加速流失。】
今天再问同样的问题,坤元1.1回答:
【社区团购增长可以从用户拉新、活动运营、供应链优化、履约体验等多个方面展开,希望对您有所帮助!(笑脸)】
群里开始有人疯狂翻历史记录。
昨天用过坤元的人,都纷纷发出自己保存的对话截图。
群里又讨论了几百楼,突然有一句话引起了林一舟的注意。
【鼎盛是不是把发布会特供版下线了?】
奇怪的是,在微信上讨论这个问题的人很多,但是在微博上热搜榜上却没有,连昨天的热搜【#坤元发布】【#让AI听懂中国】都不见了。
林一舟甚至觉得自己在昨天短暂的出现了幻觉,幻想国产出了一个好用的AI。
坤元1.0,从此成了一个流传在网际网路上的另一个都市传说。
鼎盛大厦,吕云的办公室里,吕云坐在办公桌後面,刘大海坐在他对面的椅子上,心里多少有些忐忑。
昨天晚上,他被从家里紧急叫回实验室,从过去两三个月里的模型里选了一个「乾净」的,表现最好的出来,命名成坤元1.1,加班加点的过了一遍基础测试,然後就全网上线替换了坤元1.0。
所谓「乾净」,就是指还没用那批高质量标注的版本。
虽然没有人和他明说,但刘大海大概猜到了,那批标注果然有问题,现在被爆出来了,才需要这样紧急处理。
这种事情他以前也不是没见过,几家大模型互相蒸馏,有的时候清洗不乾净,会出现那种问A模型「你是谁」,回答「我是B模型」的情况,这种事出来的都会在圈子里有一波舆论,大家也习惯了。
——
但是这批数据清洗的时候他是仔细看过的,不应该犯这种低级错误啊。
「大海啊。」吕云开口,打断了刘大海飘飞的思绪,「你来鼎盛有两年了?」
「一年半了,吕总。」刘大海赶紧回神,回答道。
吕云微微点了点头,露出一点笑容:「不错,从你进来,乾元就交给你,坤元也是你主导的。」
刘大海额头开始冒汗了,确实,鼎盛大模型研发的技术方向都是他定的,现在坤元大概出事了,刚做了紧急处理,吕总这不会是要算总帐了吧。
他想给自己辩解一下,说早在发布之前他就提出过不同意见,但是被林绍峰给堵嘴了0
但是他又怕这话说出口,反而被当成是在狡辩。
唉,刘大海连见郑晓波都紧张,今天见到传说中的吕总,心理压力实在有点儿大了。
吕云没让刘大海胡思乱想太久,很快就进入了正题:「大海啊,我今天叫你来,是想给你加点儿担子。」
刘大海一愣,什麽意思?
「我自己思考过了,大模型研究想要成功,还是得由技术这边主导,研究院这边的架构改一改,你的职级提一级,还是叫首席科学家,但是研究院就由你来管了。」
刘大海反应了一下,喜悦还没涌上来,他问出口的第一个问题是:「那林总呢?」
首席科学家管研究院,原本管研究院的VP干什麽?
吕云也没想到刘大海问的这麽直接,但还是回答道:「他会调到鼎盛云去,你们两个以後还要配合。」
刘大海在心里合计了一下,鼎盛云本来不是张弛在管吗,那张弛呢?
但是这个离他就太远了,他没再问。
不管怎麽样,升职了就是好事。
刘大海开口感谢大老板的赏识,吕云又开口问了几个技术上的问题。
「现在这个版本,和当初发布会上的差多少?」
这是吕云最关心的问题。
「意图理解,尤其是中文环境下的意图理解,差距比较大,从九十多降到了不到八十「」
。
要说这个,其实刘大海是最委屈的。
坤元系列所有的模型都是他花了很大心血一步一步带过来的,发布会上的版本,用了那批「黄金标注」做後训练,中文的语义理解能力提升了一大块。
可是坤元本身的知识、逻辑、数学能力,也是处在闭源模型的第一梯队的。
结果发布会上着重强调的语义理解能力,和现实情境结合的能力,回退之後全没了,现在他能看到的舆论都在说坤元变笨了。
这还是被公关过的舆论,要是真让网友们在网上放开了聊,坤元1.1不知道会被人骂成什麽样了。
多他妈委屈啊!
吕云听完刘大海的回答,缓缓点了点头,又问了一个问题:「想要做回发布会上的那个效果,你有方向了吗?」
刘大海这次来了自信:「有的,吕总,有的。咱们已经验证过了,标注要做成什麽标准,就能提升意图理解,接下来只要在这方面加大投入,组建高水准的标注团队一不是普通的标注员,文科的高材生,什麽学哲学的、心理学的、语言学的,花个半年的时间,我有信心做出发布会上的那个水准来。」
这才让吕云有点儿欣慰。
能快人一步自然好,如果做不快,那就做得好吧。
几天之後,美国,西海岸,NeusAI的办公室里。
CE0瑞恩再次把坤元1.1的实测报告看了一遍。
这已经是第三份报告了。
第一份来自产品团队,第二份来自研究团队,第三份来自外部社区数据汇总。
三份报告的结论基本一致。
坤元1.1的综合能力不错,但远远没有发布会表现出的压迫感。
尤其是中文复杂业务场景,它仍然有优势,却不是不可追赶的优势。
CT0约翰坐在会议桌另一侧,脸上的表情明显很放松。
「所以,发布会那天他们展示的到底是什麽?」瑞恩问。
约翰摊了摊手:「可能是一个特殊版本,可能是过拟合了评测和演示场景,也可能是他们上线後做了安全收缩。总之,现在我们能测到的版本,不值得我们修改金星的发布节奏。」
他当时就说过了,估计是规则层调教过的,不是模型的原生能力。
现在可以证实了。
市场负责人麦可也松了一口气。
前几天看完鼎盛发布会,他是真的有点紧张。
如果中国大厂真的做出了一个极度理解中文业务场景的模型,再叠加鼎盛的渠道和客户资源,那会对NeusAI的海外扩张和中国市场判断形成很大压力,再加上现在增长势头正猛的御风和Kaiwu海外版,NeusAI的处境会很危险。
但现在看来,事情远远没有那麽可怕。
中国网际网路的舆论已经替他们完成了第一轮质疑。
「刷分造假」这个标签一旦贴上去,想撕下来就很难了。
哪怕以後鼎盛真的再做出更好的模型,大家也会先问一句:这次是真的吗?
瑞恩也轻轻的出了一口气。
多一个竞争对手,他虽然不怕,但是少一个又有什麽不好呢?
鼎盛的事情过去,瑞恩又抬起头,问了团队另一个问题。
「源码科技那边,准备的怎麽样了?数据我们已经都收集完了,3月过完,合同到期,就把他们的权限都封了。」
在坤元发布会後的第二天,和鼎盛完成了争议和解的签约後,韩路一就停止了对鼎盛的关注。
他还有更重要的事情要忙。
时间已经来到了3月中旬,汤圆训练完成,分数测完了,应用场景的接入也都测完了,效果甚至比预期的还要好不少。
但是部署在源智自己的机房这件事,还在紧锣密鼓的进行中。
所以韩路一没有急着对外发布。
以源码科技现在的用量,开物和御风加起来日活已经过十万了,等到汤圆发布之後,网页端的AI机器人势必还要带来一波新的流量。
可以说一发布就要面对流量压力。
韩路一又不想把汤圆部署在任何一个云平台上,只能尽快把现有的五百张卡和後续从鼎盛那来的两千张卡的利用起来。
技术难度比之前想的还要大一些。
虽然只是用国产卡做推理,不涉及训练的部分,但是毕竟是第一个这麽做的公司,全是摸着石头过河。
再加上张家口那边的量大起来了,还要专门组一个运维的团队。
韩路一估计着,去不去京城先不说,得先把分公司开到张家口去了。
从过完年之後,张彪就一直驻紮在张家口忙着机房的事,韩路一想了想,觉得自己还是得亲自去一趟,把赵文渊也带上。
安排了一下行程,刘或给三个人订了3月15号的机票。(记住本站网址,Www.WX52.info,方便下次阅读,或且百度输入“ xs52 ”,就能进入本站)