第一百八十三章 这不是有戏了吗?

    一月十一日,周一。

    上午九点,韩路一走进前滩中心十二楼,源码科技的办公室。

    周末刚过,办公室里已经恢复了工作日的节奏。开放工位区里零星坐着几个来的早的工程师,两个人一边看屏幕一边低声讨论,茶水间门口还有人端着咖啡往回走。

    看见韩路一,他们都停下来打招呼。

    没人奇怪韩路一为什麽几天没在公司,又突然回来,大家都渐渐适应大老板的神出鬼没了。

    韩路一没有去自己的办公室,而是先去了苏念念的办公室。

    苏念念的电脑屏幕上正放着陈建业发来的评审流程数据。她看到韩路一过来,点了点头,又转头把注意力放在屏幕上。

    「你回来啦。」

    韩路一笑了:「累死我了,周末睡了两天回血。我不在的时候还顺利吗?」

    苏念念听他这麽说,抬头仔细观察了一下他的脸色,才放下心来,说:

    「上次和你说的,小姜做的那个智能体编程,你应该去开发区看一眼。」

    「效果很好?」韩路一挑了挑眉。

    苏念念笑了笑:「给你留个惊喜,等小姜来了你去问她,她提前准备了报告呢。」

    韩路一出门看了看,姜亦心已经在工位上了。

    韩路一走过去,站在姜亦心的工位旁边,轻轻敲了敲隔板。

    「韩总,你回来啦!」姜亦心转过头,吓了一小跳。

    「苏总说你做的智能体效果很好?」

    「是钱晓乐和我一起做的。」姜亦心一边拉数据一边强调,「韩总你看,这是上周的数据。」

    「全公司一线开发共三十人,上周合并代码分支一百二十七个。」

    姜亦心指了指右边的柱状图。

    「之前的数据是平均每周四十七个。」

    她又指了指左边的柱状图。

    「但是这个数字还没到顶,因为大家都在适应。」

    【写到这里我希望读者记一下我们域名 读选 101 看书网,.超流畅 】

    姜亦心又在数据上加了一个筛选条件。

    「你看,钱晓乐,她用的最早,上周二一天就合并了十个代码分支,这可都是生产项目。」

    韩路一看着这个数据,不禁身体前倾,把右手撑在了姜亦心面前的桌子上。

    他自己做了五年多的程式设计师,他知道每天十个合并是什麽概念。

    一个代码合并包括从理解任务需求,和其他部门沟通,同步信息,完成改动,编写单元测试一系列步骤。改动有大有小,但是平均下来,一人一天能有一个合并就是合理的工作量了。

    现在钱晓乐一个人就做了十个人的量。

    从很多年前开始,矽谷就鼓吹「十倍工程师」的概念,指的是一个非常厉害的天才程式设计师可以一个人做出十个普通程式设计师的贡献。

    现在的钱晓乐,至少在这一天里,已经接近了「十倍工程师」的样子了。

    更重要的是,这种能力不是天赋。

    而是工具带来的!

    只要使用流程继续优化,源码科技的三十个开发,产出还会被整体再抬高一个档次。

    「代码质量呢?把合并的改动拉出来我看看。」韩路一问道。

    姜亦心早有准备:「智能体首次提交的通过率现在是百分之六十七。大概有三分之一的任务现在的智能体还没法独立完成,会卡死,这个时候需要人工介入。」

    然後她直接打开代码库,找出了钱晓乐最近合并的改动。

    韩路一开视界扫过去,基本全是绿的。

    这是非常夸张的效率提升了。

    三十个人干出来一百个人的活来。

    本来上个月韩路一还在盘算,如果要把开发团队从三十人扩到六十人,光是招聘、面试、入职培训,最快也要三个月。而海城这个市场上,能招到的合格工程师,月薪没有三万打不住。

    三十个人,一年就是一千多万的人力成本。

    可是不招人,源码业务发展的又太快,需求都做不过来了。

    现在姜亦心和钱晓乐搞出来的这个东西,等於他不用多花一分钱,凭空多了七十个人。

    不对。

    比多七十个人还好。

    多七十个人意味着多七十个人的管理成本、沟通成本、磨合期。

    而智能体不需要开会,不需要团建,不需要一对一沟通,管理成本大大降低了。

    韩路一看向姜亦心,认真地说:「小姜,这个工具的优先级提到最高。你需要什麽资源,直接找苏总要。」

    姜亦心还是第一次见韩总用这种语气说话。

    「好的韩总!」姜亦心顿了一下,补充道:

    「对了,还要多亏陈总新设计的评审流程,我们最近在开发基於大模型的评审工具,除了用BugKiller做bug检测之外,还加入对代码风格和可维护性的建议。」

    听到「陈总」两个字,韩路一恍惚了一下,他还以为是陈博文。

    然後他才意识到,姜亦心指的是陈建业。

    哦,对了,他升技术负责人了。

    韩路一又表扬了姜亦心两句,给小姜夸的都不好意思了才离开。

    他还要去十三楼模型组的地方找赵文渊。

    ……

    「文渊,你说的不太顺利,具体是指什麽?」韩路一问道。

    「韩总,国产适配的事,恐怕不可行。」赵文渊苦着一张脸,开口道。

    「技术上有难度?」韩路一挑了挑眉,已经准备自己开视界上了。

    「不是。」赵文渊叹了口气,「工程量太大了。」

    「CUDA做了十几年的生态,你让我带着模型组这几个人,别说适配生态了,一个算子的迁移都搞不定。」

    韩路一倒是不觉得意外。

    生态要是好做,国内的这些硬体厂商早做完了,哪还有这些问题?

    「拿个例子来看看。」韩路一说。

    赵文渊觉得韩路一有点儿多此一举。

    就算你再能写,也不能让你一个一个写过去啊。

    况且你不是已经在做标注了吗?

    赵文渊没把这些话说出来,乖乖的从代码库里找出了一个算子的代码做例子。

    scaled_dot_product_attention

    这是变形金刚(Transformer)架构中比较重要的一个算子,可以说没有这个就做不了大模型。

    「N卡那边有专门的函数,性能和精度都做过深度优化,我手头连个等价实现都没有。」

    韩路一拉过一个椅子坐在电脑前,接过滑鼠,打开浏览器把相关的CUDA原始码、国产显卡的IR文档、HCCL SDK都打开来。

    赵文渊在旁边看的一愣:

    「韩总,你要干什麽?——你不会是要,自己写吧。」

    韩路一头也没抬:「试一试。」

    试一试?赵文渊心里吐槽,韩总,这可是一个团队几个月的工作量。

    韩路一已经打开视界,把CUDA实现中的几个关键地方都扫了出来,然後把要适配国产显卡的要点总结了一下。

    接着韩路一在赵文渊的电脑上打开了姜亦心的AI智能体编程工具。

    但他没把视界看到的关键信息都输进去。

    他想先看一眼,仅靠模型自己能做到什麽程度。

    他输入了第一段提示词:

    「把这个 CUDA算子翻译成国产卡 IR实现。要求精度误差小於 1e-5,性能不低於 N卡实现的70%。下面三份文档作为上下文。」

    然後把浏览器里的连结地址都打了进去。

    很快AI智能体开始自己分解任务、解决任务,最後汇总。

    三分钟後,第一版结果出来了。性能接近 68%,但精度偏差太大了。

    一个大大的红色FAIL显示在屏幕上。

    赵文渊在旁边松了一口气。

    这才正常嘛。

    他对韩路一说:「韩总你看,这就是我说的难点,做不过来——」

    韩路一没有回应赵文渊。

    他重新打开CUDA的原始码,开了视界。

    普通人看代码,看到的是字符。赵文渊看代码,看到的是逻辑。

    但视界让韩路一看到的是另一层东西,不只是代码在做什麽,还有代码为什麽这样做。

    每一个设计选择背後的权衡,都像批注一样浮现在代码旁边。

    为什麽softmax没有用最直觉的实现方式,而是拆成了三个阶段?因为直觉实现在长序列上会有数值溢出。

    为什麽矩阵乘的分块是这个尺寸,不大也不小?因为再大shared memory放不下,再小会产生内存冲突。

    这些东西没有写在任何文档里。它们是英伟达的工程师经过无数次实验之後沉淀下来的经验,藏在代码的结构里,只有真正理解硬体的人才能读出来。

    赵文渊不是读不懂代码,他只是没办法在几天之内,就把别人几年的工程经验全部提炼出来。

    但是视界可以,韩路一可以。

    韩路一关掉第一版的提示词,重新输入。

    这一次,他没有让智能体自由发挥。

    而是把视界看到的东西直接输入进去。

    「softmax必须使用 online algorithm三阶段,不要使用 naive softmax。当前精度问题出在第二阶段 reduce,局部最大值和指数和更新顺序要保持一致。」

    「矩阵乘 tile使用64x64,tile过大 shared memory不够,过小会增加 bank conflict。」

    「reduce时按4-stride展开,避免 bank conflict。」

    「K/V矩阵按 row-major缓存在 shared memory,避免跨 bank连续冲突。」

    「先保证精度,再做性能优化。」

    回车。

    智能体又开始勤勤恳恳的劳动了。

    五分钟後,一个大大的绿色PASS出现在屏幕上。

    赵文渊在旁边眼珠子都快要瞪出来了。

    「不是……这怎麽回事?」

    他不顾韩路一还坐在电脑前,把头凑到屏幕前面,把测试报告从头到尾看了一遍。

    精度误差:2.3e-6,远低於1e-5的要求。

    性能:N卡实现的83%。

    不是70%,是83%。

    赵文渊又把生成的代码拉出来,逐行看了一遍。

    他越看越沉默。

    这段代码根本不是那种「能跑就行」的粗糙实现:softmax用的是三阶段online algorithm,reduce的展开策略乾净利落,shared memory的使用几乎没有浪费。

    这是一个对底层硬体有深刻理解的人才能写出来的东西。

    不,准确地说,是一个对底层硬体有深刻理解的人,才能指导AI写出来的东西。

    赵文渊转过头,看着韩路一。

    「韩总,你第二次输入的那些提示词——softmax三阶段、tile 64x64、4-stride展开——你怎麽知道的?」

    韩路一靠在椅背上:「我看了文档。」

    「我去,原来你看了文档啊,不早说。」赵文渊先开了个玩笑,然後声音突然拔高了,「我也看了两天文档,跑了十几个测试,我都没找到这个tile尺寸,你看了几分钟就看出来了?」

    韩路一没有回答,只是笑了笑。

    赵文渊盯着他看了好一会儿,最後像是泄了气一样靠回椅子上。

    「行吧。」他说,「我不问了。」

    他之前不是没想过用AI来做这些工作,但是AI根本做不了。每次跑出来的结果,不是卡死,就是偏差太大。

    怎麽韩路一一上手就好用了?

    赵文渊现在只想火速删掉发给韩路一的那个共享文档的标题。

    韩路一在他眼前,把他觉得不可能的事情做出来了。

    如果这个不是偶然呢?

    如果scaled_dot_product_attention可以这样做,那其他算子呢?

    什麽暂无可行性啊?

    什麽叫「别想了,没戏」啊?

    这不是有戏了吗?

    他现在非常想让那个前同事过来现场看看。(记住本站网址,Www.WX52.info,方便下次阅读,或且百度输入“ xs52 ”,就能进入本站)
这篇小说不错 推荐
先看到这里 书签
找个写完的看看 全本
(快捷键:←) 上一章   回目录   下一章 (快捷键:→)
如果您认为首富从看见信息面板开始不错,请把《首富从看见信息面板开始》加入书架,以方便以后跟进首富从看见信息面板开始最新章节的连载更新