【CNMO科技动静】近日,据外媒报导,上海交通年夜学、苏黎世联邦理工学院等机构研究职员提出一套名为COSM的新型协同调理框架,试图解决手机运行端侧年夜模子时的高功耗问题。研究显示,当前智能手机举行AI推理时,跨越60%的能量并不是用在现实计较,而是耗损于处置惩罚器与内存之间的数据传输上。
AI
跟着年夜模子逐渐从云端进入手机,当地AI既要包管相应速率,又遭到功耗、散热及内存带宽限定。研究指出,运行约70亿参数模子时,需要连续将存储于内存中的年夜量数值数据传输到计较装备,既增长功耗,也轻易造成发烧以和天生速率颠簸。
COSM的思绪是引入PIM,也就是“存内处置惩罚”。这种方案把部门计较能力放到内存四周,让数据只管即便于原地完成处置惩罚,削减重复送往CPU、NPU的次数。不外手机空间及成本有限,CPU与PIM往往需要同享统一片内存,二者同时拜候时又轻易孕育发生资源冲突。

据CNMO科技相识,为解决这个问题,COSM插手了可中止的PIM指令及余暇时段感知调理机制。当CPU需要拜候内存时,PIM可以暂时让路;体系同时判定CPU拜候中的空档,再把PIM使命塞入这些时间窗口,从而只管即便削减两边互相抢占资源。
论文试验成果显示,与基线调理方式比拟,COSM最高可将PIM吞吐量晋升2.8倍,同时把CPU机能丧失节制于2%之内。于年夜模子与平凡手机使命并行运行时,AI推理吞吐量最高晋升2.6倍,其他使命机能降落不足2.2%,单个Token所需能量也获得较着降低。
版权所有,未经许可不患上转载
-z6com·尊龙【CNMO科技动静】近日,据外媒报导,上海交通年夜学、苏黎世联邦理工学院等机构研究职员提出一套名为COSM的新型协同调理框架,试图解决手机运行端侧年夜模子时的高功耗问题。研究显示,当前智能手机举行AI推理时,跨越60%的能量并不是用在现实计较,而是耗损于处置惩罚器与内存之间的数据传输上。
AI
跟着年夜模子逐渐从云端进入手机,当地AI既要包管相应速率,又遭到功耗、散热及内存带宽限定。研究指出,运行约70亿参数模子时,需要连续将存储于内存中的年夜量数值数据传输到计较装备,既增长功耗,也轻易造成发烧以和天生速率颠簸。
COSM的思绪是引入PIM,也就是“存内处置惩罚”。这种方案把部门计较能力放到内存四周,让数据只管即便于原地完成处置惩罚,削减重复送往CPU、NPU的次数。不外手机空间及成本有限,CPU与PIM往往需要同享统一片内存,二者同时拜候时又轻易孕育发生资源冲突。

据CNMO科技相识,为解决这个问题,COSM插手了可中止的PIM指令及余暇时段感知调理机制。当CPU需要拜候内存时,PIM可以暂时让路;体系同时判定CPU拜候中的空档,再把PIM使命塞入这些时间窗口,从而只管即便削减两边互相抢占资源。
论文试验成果显示,与基线调理方式比拟,COSM最高可将PIM吞吐量晋升2.8倍,同时把CPU机能丧失节制于2%之内。于年夜模子与平凡手机使命并行运行时,AI推理吞吐量最高晋升2.6倍,其他使命机能降落不足2.2%,单个Token所需能量也获得较着降低。
版权所有,未经许可不患上转载
-z6com·尊龙Copyright © 2019-2026 成都z6com·尊龙电子科技股份有限公司 版权所有 备案编号: 蜀ICP备2022009451号 川公网安备 51019002004893号