开云(中国)Kaiyun·官方网站 登录入口

资讯
你的位置:开云(中国)Kaiyun·官方网站 登录入口 > 资讯 > 开yun体育网并把柄用户意图完成操作-开云(中国)Kaiyun·官方网站 登录入口

开yun体育网并把柄用户意图完成操作-开云(中国)Kaiyun·官方网站 登录入口

发布日期:2026-09-12 15:50    点击次数:150

开yun体育网并把柄用户意图完成操作-开云(中国)Kaiyun·官方网站 登录入口

【全球网科技概述报谈】当AI从“一问一答”的对话情势走向捏续感知、跨运用协同的智能体阶段开yun体育网,转移芯片的揣摸打算架构正面对一次新的重构。高通时刻公司家具商场高等总监Cisco Cheng近日发表签字博客著作,先容下一代旗舰转移平台将搭载的全新Hexagon NPU。该NPU针对智能体AI的捏续运行、多模态推理和低时延需求想象,引入Element Accelerator专用加速单位与大容量分享内存系统,为末端侧运行智能体AI提供硬件支捏。

从单一大模子到多模子协同 智能体AI蜕变揣摸打算需求

智能体AI大要相识用户个情面境、跨运用协同运行、捏续推理,并把柄用户意图完成操作。跟着AI智能体化长远,主流架构正从依赖单一宏大模子处理统共任务,转向由多个专用模子构成的系统,把柄任务、情境和用户需求进行智能迁移。

这一瞥变对转移揣摸打算淡薄了新条件:不仅需要更快的AI推理才智,还需要面向捏续运行、多模态且低时延场景想象的架构。下一代骁龙旗舰转移平台为此引入全新Hexagon NPU,包含两项关键特色——Element Accelerator和扩张后的大容量分享内存系统。

Element Accelerator与分享内存协同 助力升迁智能体反应速率

Element Accelerator专为生成式AI和智能体AI的Transformer责任负载想象,勾搭向量揣摸打算单位和标量揣摸打算单位,加速大模子中的关键运算,匡助智能体升迁反应速率和推理后果,同期兼顾转移端能效。

与此同期,Hexagon NPU扩张了大容量分享内存。通过将多模子景色、凹凸文信息和KV-cache数据存储在更揣度加速器的位置,该平台大要缓解内存瓶颈,使智能体在处理更长凹凸文、调用更多用具以及实践并发任务时保捏畅通反应。大容量分享内存减少了拜谒外部内存的频次,支捏更长的凹凸文窗口和更快的token生成速率,使智能体在用具和任务之间切换更为顺畅。

在揣摸打算单位层面,向量揣摸打算单位精良高迷糊量AI数学揣摸打算,标量揣摸打算单位则支捏智能体对决议逻辑、路由和编排才智的需求。三者与分享内存构成协同架构,共同加速Transformer责任负载、处理截止逻辑复杂的智能体任务,并将凹凸文数据保留在揣度揣摸打算单位的位置。

搀和民众模子与多精度支捏 均衡性能与功耗

Hexagon NPU同期面向下一代模子架构想象。高通时刻公司正与内存和模子厂商协作,引入搀和民众模子(MoE)构建末端侧AI架构。以一个300亿参数的MoE模子为例,在保捏数百亿参数可用的同期,NPU每次生成一个词元仅需激活约30亿个被路由选中的参数。与每次推理都需要大部分网罗参与的密集模子不同,MoE把柄输入动态聘请专用民众网罗,从而减少本体揣摸打算负载和内存带宽需求。勾搭民众模块闪存到内存的加载贬责机制与缓存时刻,该法子大要以较低功耗和内存需务已毕较大模子级别的AI体验。

在精度支捏方面,该平台遮蔽INT2、INT4、INT8、FP8和FP16,使诞生者大要在性能、内存、模子质料和功耗之间得回均衡。鸿沟较小的模子可承担更多端侧AI任务,较大模子则在处理复杂任务时调用。关于基于INT4的模子,该平台可已毕最高50%的预填充性能升迁,同期加速解码迷糊速率、增强推测解码,升迁每秒词元生成速率。

末端侧智能体AI参预硬件落地阶段

智能体AI的中枢特征是捏续运行和即时反应,这条件揣摸打算才智尽可能揣度用户、留在末端侧,而非皆备依赖云霄。下一代Hexagon NPU通过加速单位、分享内存、多精度支捏和模子加载机制的协同,使更多智能才智大要在末端运行,同期兼顾反应速率、秘籍保护和功耗截止。

从对话式AI到智能体AI,转移揣摸打算的重点正在从“单次推理”转向“捏续协同”。Hexagon NPU的时刻布局标明,芯片厂商已启动从硬件架构层面陈述这一变化开yun体育网,末端侧智能体AI正从宗旨走向可落地的家具体验。跟着下一代骁龙旗舰转移平台的推出,这些时刻将参预奢靡末端,采纳信得过运用场景的西宾。(心月)