下午,韩路一终於见到了第一天入职的江松然。
两人在十三楼找了一个空会议室。
简单的客套了两句,江松然就忍不住问起了工作:「韩总,今天上午赵总带我看了一遍进度,说实话,我很震惊,比你在医院给我看的那些成果更惊人。」
韩路一知道江松然已经看过源智科技藉助智能体能达到什麽效率了。
这是在短时间之内追赶英伟达的CUDA生态,把不可能变为可能的关键。
拿出几个算子的适配成果,很牛,但不能改变行业。
拿出一个能稳定快速完成算子适配的系统,那就不一样了。
江松然的眼界能看出来这意味着什麽。
但是同时,韩路一也好奇江松然作为一个AIInfra专家能给源智科技带来什麽。大的方向上他已经想好了,要做到两点。
一是拥有自己的训练和推理栈数据跑在别人的云上,他不放心。
二则是使用国产化替代这是一件一举两得的事,首先英伟达的卡因为种种原因,他就根本买不到;其次他有能力也有动力率先完成算力的国产化替代,如果能做到,不仅自己的数据中心的问题解决了,也能打开更广阔的国内政企市场。
但是方向定好了,具体实施还需要实际在这个行业里做过的人才。
这也是为什麽江松然对源智科技这麽重要的原因。
江松然是行业大佬,技术深厚不假,但是他对源智科技最大的价值其实在於另外一点:江松然在之前的那家创业公司是做一号员工、高管的,他有过把数据中心从零到一搭建起来的经历,而且他的经验横跨软体和硬体。
这样的人才远比一个技术大牛更加稀缺。
可以说,他对源智的重要性远远高於他对鼎盛、崑仑的重要性。
那些大云服务供应商都已经有了丰富的数据中心管理经验,江松然去了那里,顶多是带来一些新的视角,在某些方面带来一些提升,但不能有什麽本质上的突破。
但是江松然来到源智科技,直接把源智科技在硬体管理上的空白给填补上了。
所以韩路一才会这麽慷慨,直接给了2%的期权奖励。
这可是视哥认证的金色传说!
江松然可能赚了,但韩路一绝对不亏。
既然江松然提起了,韩路一就直接问道:「江博士,我们现在要做的是尽快拥有自己的推理栈和训练栈,我一期计划的是五百张卡,这个采购量在国产卡里不算大,哪家都拿的出来,但是具体从哪买,买来能做到什麽程度,我还想听听你的意见。」
这个数字韩路一在医院的时候就已经和江松然透露过了,江松然也早就做好了准备他知道入职之後韩路一是一定会问的,他不打无准备之仗。
「韩总,我回去看过了,现在市面上最先进的国产卡能做到400TFLOPS,如果只是推理的话,五百张支撑十万日活绰绰有余。」江松然说,「基於标注数据的後训练,虽然勉强,但也能做。但是要做预训练,是远远不够的。」
TFLOPS(TeraFLOPS, Trillion Floating—point Operations Per Second)是衡量计算机算力的单位,中文是「每秒一万亿次浮点运算」。因为GPU的强项就是进行浮点数学运算,如果把每个GPU都比作一辆跑车的话,TFLOPS就是它仪表盘上的最高时速。
用N卡体系来举例的话,游戏玩家的梦中情卡RTX5090在AI实际用的精度下大概能做到200TFLOPS,而专业用於AI训练的英伟达B200型号显卡,能达到单卡2250
TFLOPS的恐怖算力。
韩路一点了点头,这和他设想的没有出入。
「而且,韩总,我不知道咱们团队里有没有人有过显卡集群管理的实操经验。但是,非CUDA生态显卡集群的管理难度和CUDA生态是完全不一样的,五百张国产卡,全国能把训练栈跑通的不超过三家。」
说完,江松然露出略微骄傲的神色:「有我在,我有信心源智科技是其中一家。」
韩路一对此倒是不怀疑,毕竟他招江松然进来,就是要他干这个的。
他接着问道:「那从哪家采购最好,你有什麽建议吗?」
江松然微微沉吟了一下,没有马上回答。
这个问题其实有点儿敏感。江松然当过管理者,当然知道对於任何一家公司来说,采购都是敏感话题,更何况AI用显卡的单卡价格都在十万以上,五百张就是五千万的采购,金额可不小。
如果是为了安全,他最好是给出一家国产头部大厂的推荐,大厂内控严厉,给他回扣的风险小,韩路一也更不会怀疑他。
但是江松然在做过调查之後,确实发现了一个更好的选择,只是说出来未必对他本人是一件好事。
他没有犹豫太久,还是咬了咬牙,说出了更冒险的版本:「有一家,叫矽明半导体(
Sili—Lumin),总部在鹏城,也是个创业公司,去年刚开始量产第一款产品,叫L100,算力600TFLOPS,片间互联带宽600GB/s,对标的是英伟达的H100。硬体的料很足,而且还有一个对我们来说是优点的缺点一他们的软体做的很差,完全没有训练的落地配套,买家全是在做推理。」
「所以矽明对咱们来说格外合适,五千多万的单子,对他们来说是救命稻草,而且他们的销路不好,有现货。」江松然把自己的思考都说了出来,「再加上他们的软体弱,硬体强,按硬体单价算性价比就特别高。而我们根本不用他们的配套软体,相当於采购的钱全花在硬体上了。」
这话说完,江松然也心里打鼓。
他明确表示了这是他提前调查过的厂家,韩路一会不会怀疑他吃了回扣?
他心里默默想了一句话:他以国士待我,我当以国士报之。
韩路一面上不动声色,只是眼睛发亮。
他没什麽犹豫,直接说道:「江博士你费心了,确实很适合源智现在的需求。这样,你不方便出差,一会我让我的助理过来找你,你和他交代清楚,让他跑一趟鹏城。」
江松然心里松了一口气。
不让他经手他感到挺庆幸的,至少可以避嫌。
正事聊完,韩路一最後又说了一句:「你既然说有信心,我很期待咱们把自己的集群搭起来的那天。」
实际上江松然说的还保守了,他不只是有信心。这个事情他做过一遍了,再做一遍当然是十拿九稳。
实际上现在见识过了源智科技的技术潜力,他觉得不止是五百卡、千卡的集群,就算是万卡也不是不能尝试。
要知道,想把显卡集群做大,其中的技术难度是指数级上升的。
因为真正的挑战来源於在使用过程中,集群里的各个节点之间的通信。想要完成大模型的训练,就要让各个节点之间数据完全同步。假设只有十个人,想要让他们互相交流一个信息,不是什麽太难的事情;可是如果扩大到一百个、一千个人,每个人都各自在做自己的事情,即使是简单的信息同步也很难做到。
而且万卡集群比起千卡集群,运算速度并不能提升十倍,受通信带宽的限制,能达到七八倍就不错了。
成本极高,收益不大,既然这样,那为什麽还要做万卡集群呢?直接做很多个小集群不行吗?
那是因为万卡集群能做到千卡集群做不到的事情,就是训练超大模型。
基於现在的大模型理论,模型越大,参数越多,模型的能力就越强。可是想要把那麽多信息训练到一个模型里,就需要能够同时容纳所有原始信息的内存,只有使用万卡这个规模的集群,才有可能训练出这样的超大模型来。
可以说万卡集群才是英伟达体系王冠上的明珠。
而现在,江松然已经有野心在源智科技用国产显卡挑战万卡集群了。
当然了,AI训练用显卡的成本,即使国产的成本低很多,单卡价格也在十万元人民市以上。要做万卡集群,单是显卡成本就要十亿。更别说这个级别的集群,配套的机房、电力、冷却、存储等等成本加起来是显卡本身的一倍左右,万卡集群的总投入要在二十亿以上。
但是这些事情江松然都不担心。那不是CE0应该担心的问题吗?他相信到时候韩路一会解决的。
这些念头在江松然的脑子里转了一圈,什麽都没说出口。
只是他那颗因为家中变故而变得沉寂的心,突然又火热起来了。(记住本站网址,Www.WX52.info,方便下次阅读,或且百度输入“ xs52 ”,就能进入本站)