科技日报记者 刘霞
跟着ChatGPT横空出世避世,推理人工智能(AI)局限的芯片新轮竞争进进白热化 。英伟达公司的激起高端图形措置单位(GPU)芯片“一飞冲天”,遭到各除夜科技公司追捧。独霸与此同时,立异也有一些草创公司另辟路途,推理专注于研制此外一种芯片——AI推理芯片 ,芯片新轮为AI产品的激起畅旺展开和独霸注进全新动力 。
据物理学家构造网不日报导,独霸这些AI推理芯片旨不才出世成式AI所需的立异昂扬筹算成本 ,更贴合AI对象的推理往常运转请求。此类芯片成本的芯片新轮不竭下探和功用的延续汲引,有看掀起新一轮AI独霸立异海潮 ,激起让更多宏壮且壮除夜的独霸AI独霸走进千家万户。
推理筹算需求水长船高
操练与推理,立异是AI除夜言语模型两除夜中心身手的刚毅基石 。
在独霸过程中 ,经由操练的ChatGPT等生成式AI对象会吸纳新信息 ,从中举办推理并生成回应,如撰写文档、生成图象等 。这类AI对象可独霸于医疗诊断、主动驾驶、天然言语邃晓等局限。
跟着AI模型的普及独霸 ,需求举办推理筹算的硬件日趋增多,对推理芯片的需求也将“水长船高”。国际数据公司(IDC)的陈述展示 ,将来几年,推理端的AI处事器占比将延续爬升。估计到2027年 ,用于推理的工作负载将占据七成以上。
科技公司竞推新产品
Cerebras 、Groq和d-Matrix等草创公司,和超威半导体公司(AMD)和英特尔等传统巨擘 ,纷纷推出了AI推理芯片 。这些公司活络捕获到了AI推理芯片“除夜显身手”的契机。
据Cerebras公司官网报导,2024年8月28日 ,该公司推出了同名AI推理芯片 。这款芯片在Llama 3.1-8B模型上完成了1800token/秒的推理速度;在Llama 3.1 70B上完成了450token/秒的推理速度 ,约是英伟达GPU推理速度的20倍 。Token指AI措置文本的最小单位或根本元素,如一个单词 、一个字符等。
Cerebras公司诠释说 ,这一超卓默示得益于其立异的AI芯片筹划筹划。其晶圆级引擎(WSE)似乎一座重除夜的“筹算工厂”,最除夜特点是尺寸惊人——单个芯片几近占据了一整块晶圆的面积 。在这个超除夜芯片上,筹算单位和内存单位高度集成 ,构成一个鳞集的网格筹划 。多么的筹划 ,让数据能在极短距离内,于筹算单位和存储单位之间传输,从根柢凹凸降了数据挪动成本,措置了GPU推理没法阻拦的内存带宽瓶颈。此类除夜芯片能更快措信赖息 ,从而在更短时额定给出谜底 。
早在旧年2月,Groq公司就宣布了本身的AI推理芯片GroqCloud 。它在Llama 3.1 70B模型上完成了250token/秒的推理处事,速度比GPU几近汲引了一个量级 。

旧年11月19日,硅谷草创公司d-Matrix宣布,其首款AI推理芯片Corsair已最早出货,旨在供给聊天机械人和视频生成等处事。Corsair在单处事器气候下 ,能让Llama3 8B模型完成60000token/秒的措置身手,且每个token的迟误仅为1毫秒,充分彰显了其在高速措置除夜局限数据方面的超卓功用。更值得一提的是 ,与GPU及其他筹划比照 ,Corsair能在供给齐截功用的同时 ,除夜幅降低能耗和成本 。
独霸斥地走上新赛道
亚马逊 、谷歌、元宇宙平台、微软等科技公司纷纷斥巨资 ,抢购昂贵的GPU,以期在AI斥地赛道拔得头筹。与此同时,AI推理芯片建造商则将目力目力眼光对准了更普及的客户群体 ,希看能在这片新蓝海中除夜显身手。
这些埋伏客户不乏那些盼看独霸新兴的生成式AI技能,却又不想除夜费周章自建AI根本行动办法的财富500强企业 。并且,采办AI推理芯片比从英伟达等公司采办GPU便宜 。AI推理芯片旨在优化推理筹算的速度与屈就,出格善于智能建议、语音辨认、天然言语措置等局限。
业内专家称,一旦推理速度汲引至每秒数千token,AI模型将能在眨眼之间完成宏壮问题标思虑与答复过程。这不单能让现无益用的交互屈就完成质的奔驰,还将带来一系列令人耳目一新的人机交互场景 。比如,在语音对话局限 ,延时将被膨胀至毫秒级 ,能完成近乎天然的对话体验;在虚构理论/加强理论局限,AI将能及时生成和调剂虚构气候、角色对话和交互逻辑,给用户带来赋性化 、沉沦式体验。
文章推荐: