控制节点负责把计算任务拆分后分配到每个节点,再把结果汇总回来。
网格互联的拓扑结构在他的脑海里自动铺开,四乘六乘五的三维网格,每个节点与相邻六个节点相连。
这种结构的最大优点是对通信延迟不敏感,数据在网格中传递的路径长度有限,最长路径不超过十几跳。
光纤通信已经把单跳延迟压到了微秒级别,整个网络的通信开销完全可以接受。
存储体系的分层结构也自动成型了。
编程接口的改造相对简单。
在现有的汉语指令集基础上增加几条并行指令,让程序员可以用并
(本章未完,请点击下一页继续阅读)
这种方案的通信开销占比较低,并行效率能做到百分之八十以上。
操作系统需要重新设计。
现有的汉语言系统是针对单机和少量终端开发的,调度器不支持大规模并行。
他在脑子里推演了一套分布式调度方案,控制节点上运行主调度程序,每个计算节点上运行一个轻量级的从调度程序。
主程序把任务打包发送到各节点,从程序接收任务包之后独立运行,计算完成后再把结果打包发回。
林北设想中的亿次级别超算距离实现只有一步之遥了。
目前种花家的超算中心,以及各大项目的超级计算机,运算速度只有三百万次每秒。
对林北来说,这种超算速度太慢了。
林北早就想要重新打造一款超级计算机,这段时间,他也没少专研。
虽然有一些眉目,但都打不到每秒亿次的计算能力。
最顶层是每颗8080内部集成的静态存储缓存,芯片上的仙童512位缓存就做这个用。
中间层是每颗8080配备的动态存储芯片,也就是龙芯1103,用于存放当前计算任务的数据块。
最底层是共享的大容量磁芯存储阵列,存放程序的完整数据和计算结果。
计算任务的分块方案他用了数据并行的思路。
把需要计算的大型矩阵或者网格数据切成一百二十份,每份送到一个节点独立计算,节点之间仅在边界区域交换数据。
并联效率做到百分之八十的话,一百颗处理器大约需要一百二十颗左右来补足损耗。
他重新计算了一遍。
一颗8080加配套的动态存储芯片和静态存储缓存,组成一个完整的计算节点。
每个节点的理论峰值约一百万次每秒。
一百二十个节点构成一个阵列,通过网格互联网络连接起来。
这对林北来说,是没有意义的。
他计划是直接打造一款运算速度能够达到亿次的超级计算机。
而九月的这三次签到,给了林北最好的解决方案,亿次运算能力的超算,已经可以实现了。
林北把三份图纸在脑子里翻来覆去过了好几遍,然后关掉了电脑。
他靠在椅背上,闭上眼睛,大脑超算开始把三款芯片的参数逐项往一个完整的系统架构里填。
现有的第二代计算机还是台式机的尺寸,虽然比第一代小了不少但依然需要占据一张桌面。
基于龙芯8080和动态存储芯片的新一代计算机可以把主机体积压缩到现有的一半以下,甚至接近后期家用电脑的尺寸。
超级计算机的提升会更明显。
现有的超算中心使用的是CDC6600架构,处理器阵列由大量分立元件和磁芯存储器组成。
换上龙芯8080和动态存储芯片之后,同样面积的计算能力可以提升一个数量级,耗电和散热压力也会大幅下降。
每秒一亿次的运算目标需要把足够多的计算单元并联起来。
他先算了一笔基础账,一颗龙芯8080在二点五兆赫兹主频下,单条指令平均执行周期约零点四微秒,每秒大约可以执行二百五十万条简单指令。
如果全部用于浮点运算,受限于指令集的效率,实际浮点性能大约在每秒一百万次左右。要达到一亿次,需要一百颗8080并联。
一百颗处理器不是简单的堆叠。
数据交换的延迟、任务分配的均衡性、内存访问的冲突,任何一个环节出问题,并联效率都会大幅下降。
第98章 开始打造亿次运算能力的超级计算机 (第2/3页)
层做大做强就行。
龙芯1103解决的是主存储器的容量和成本问题,龙芯8080解决的是运算核心的性能和指令集丰富度问题,仙童静态存储芯片解决的是数据通路的速度问题。
三者配合使用,一套完整的计算机核心架构就从原来需要几十块板子拼接的状态,压缩到了只需要一块主板加几条内存条的集成方案。
这意味着个人计算机的体积可以进一步缩小。
阅读四合院:50年,我海归双料博士最新章节 请关注凡人小说网(www.washuwx.org)



