首页财产ai正文 唐杰预报「GLM史诗级进级」!技能论文入选顶会COLM 7月16日月之暗面放出Kimi K3,激发外界对于智谱的追问,唐杰回应“史诗级Plus”。智谱IndexCache思绪已经被GLM-5.2用过,7月21日智谱落地国产算力数据中央并收购中科加禾。 2026-07-22 15:16 ·微信公家号:量子位 henry henry AI投资人解读· 智谱于模子优化上有进展,IndexCache能解决DSA计较瓶颈问题,GLM-5.2已经采用近似思绪IndexShare。7月21日智谱落地1GW级国产AI算力数据中央,收购中科加禾,完美整条链路。 · 行业竞争激烈,新模子不停推出,智谱需连续立异连结竞争力国产算力与软件成长尚处阶段,整合效果待察。 总结:智谱于技能优化与财产链结构上踊跃推进,具有必然投资潜力,但面对行业竞争与技能整合危害,需存眷其后续进展和技能运用效果。

对于在智谱的这波“回撤”,外界已经经有许多说法,但最扎眼的导火索可能来自偕行。

7月16号,月之暗面放出了Kimi K3。总参数2.8万亿,原生撑持视觉理解及100万Token上下文,Kimi称它为全世界首 个开源的3万亿级模子。

接下来的几天,各人都知道了。

不外,也就是这周开盘前一天,有网友跑到智谱首席科学家唐杰的微博评论区,追问于千问、Kimi接连完成史诗级进化后,智谱还有有戏吗?

唐杰只回了一句:史诗级Plus。

模子名没有,发布时间没有,参数范围也没有,氛围这一块先给足了。

不外,顺着这条评论往上翻,还有真能找到一条技能线索。

唐杰微博原po里先容的,是智谱与清华团队的一篇论文——

IndexCache: Accelerating Sparse Attention via Cross-Layer Index Reuse。

论文3月挂上arXiv,7月被COLM吸收。

于po文里,唐杰暗示IndexCache只改几行代码,就能把DSA留下的一笔隐性开消削失。

按理说,一篇3月上线的论文,到了7月又被零丁拎出来,原来就有点显眼,再加之唐杰这类年夜佬,此刻也很少零丁宣传某篇事情。

细思之下,史诗级Plus的回应刚好呈现于这条技能帖下面。

这……上下文顿时变患上微妙起来。

以是,这篇论文及史诗级Plus,到底有甚么瓜葛?

IndexCache

简朴来讲,IndexCache其实不是一种新的留意力机制,它重要面向的是长上下文推理,解决DSA于上下文变长后,索引器反而成为计较瓶颈的问题。

以往DSA的思绪,是于每一层留意力前放一个轻量级索引器。

索引器先从完备上下文里挑出最主要的部门Token,让主留意力只处置惩罚这些Token,从而年夜幅降低计较量。

但问题于在,虽然主留意力不消再看完备上下文,但索引器仍要扫描一遍,并且模子的每一一层都要从头扫描。

由此,上下文越长,索引器越轻易从省算力的辅佐,酿成新的计较瓶颈。

于论文测试的30B模子中,上下文拉到200K时,索引器已经经占失81%的预填充时间。

IndexCache的立异的地方就于在捉住了这个较着的反复动作。

相邻模子层选出的主要Token高度相似,top-k索引重合率到达70%到100%。既然几层挑出的成果差未几,就不必每一层都从头算。

以是,它的焦点思绪就是:少数层卖力计较索引,其他层直接复用。

于详细实现方面,模子只保留少数索引器,算出top-k后缓存;其余层跳过计较,直接沿用近来的成果。

对于现有模子,可以按照丧失变化搜刮哪些层合适保留。

练习新模子时,则让一个索引器同时进修办事后面几层。推理代码只需增长一次前提判定,也不分外占用GPU显存。

试验效果上,于30B模子上,IndexCache至多能砍失75%的索引器计较,模子效果基本稳定。

200K上下文下,天生第 一个Token前的速率最高晋升1.82倍,后续出字速率晋升1.48倍。

于GLM-5上的开端试验中,砍失一半索引器计较后,长上下文及推理能力也基本连结稳定。

到这,这篇论文的内容也就差未几竣事了,但这及史诗级plus有啥瓜葛?

GLM-5.2已经经用过了

虽然唐杰于微博里说史诗级plus,但略显遗憾的是,这篇事情的焦点思绪实在已经经于一个月前发布的GLM-5.2里用过了。

于GLM-5.2里,这套思绪名叫IndexShare。

详细的,GLM-5.2每一四个Transformer层同享一个索引器。第 一层卖力选出top-k索引,后面三层直接复用。

这及IndexCache的焦点思绪基本一致。上面的论文给出免练习搜刮、多层蒸馏及完备试验,GLM-5.2则把四层同享一次索引真正装进了模子。

靠着IndexShare等改动,GLM-5.2把上下文窗口推到100万Token。于100万上下文下,每一Token计较量降低2.9倍。

而这类工程优化开释出的旌旗灯号,不是智谱预备换失DSA,而是还有于沿着这条线路继承榨效率。

对于模子厂商来讲,能不克不及撑持百万Token是一回事,能不克不及以可接管的成本真正用起来,又是另外一回事,而IndexShare就注解智谱仍于经由过程跨层复用压低长上下文的推理成本。

难不可?这GLM-5.3,又是极 致的性价比??

One more thing

除了了模子软件侧的优化外,方才,智谱又落下了一块更重的拼图。

据悉,就于今天7月21日,智谱已经落地1GW级国产AI算力数据中央,并全数采用国产AI芯片。

与此同时,智谱还有完成为了对于国产AI异构算力软件公司中科加禾(XCore Sigma)的收购。后者源自中科院计较所编译试验室,持久研究异构算力软件栈及编译优化,被业内视为海内顶 尖AI Infra团队之一。

两项动作,一个解决算力从哪里来,一个解决算力如何用患上更完全。

1GW国产算力为年夜模子练习提供资源,中科加禾则经由过程编译器、Runtime及推理引擎,提高差别国产芯片的使用率,降低模子练习与推理成本。

从IndexCache、IndexShare,再到国产算力中央及AI Infra收购,智谱近来补的好像不只是一款模子,而是从芯片、软件栈到模子的整条链路。

这些动作及史诗级Plus有无瓜葛,今朝还有没有谜底。

但留给智谱的牵挂,显然又多了一层。

史诗级plus,你快来吧!

参考链接

[1]https://arxiv.org/abs/2603.12201

[2]https://z.ai/blog/glm-5.2

【本文由投资界互助伙伴微信公家号:量子位授权发布,本平台仅提供信息存储办事。】【免责声明】:本文不组成任何投资建议。市场有危害,投资需审慎。若有任何疑难,请接洽(editor@zero2ipo.com.cn)投资界处置惩罚。

-lehu乐虎88国际