2020 CCF 集成电路设计与自动化学术会议
基本信息
2020-08-10
2020-08-10
中国计算机学会
会议文集
1. 300MHz抗辐照SPARC处理器设计
摘要: 300MHz抗辐照SPARC处理器BM3823以自主研制的32位SPARC V8处理器内核为核心,集成了以太网MAC、256KB片上存储、DDR2控制器和PHY、UART、SPI、I2C等外设接口.处理器设计采用模拟空间辐照环境故障模型注入仿真技术,分析处理器辐照敏感性,找出抗辐照敏感关键节点和薄弱环节,多维度进行相应的抗辐照加固,包括单元库加固、三模冗余加固、纠检错、纠错流水线设计等,在满足空间恶劣环境应用要求的基础上,尽可能优化性能和功耗.抗辐照SPARC处理器BM3823总剂量指标为300Krad(Si)以上,单粒子功能在轨错误率(GEO轨道)低于7.77x10-6次/天·器件,单粒子锁定SEL指标达到锁定免疫,与欧空局GR740的抗辐照水平相当.
提交时间:2020-08-10
2. 超大规模集成电路下通孔感知的并行层分配算法
摘要: 层分配作为集成电路设计中布线阶段的关键环节,基于2D布线方案生成3D布线方案.因此层分配需要引入通孔连接位于不同布线层上的导线.在生产工艺中,通孔的制造成本较高,因此在保障可布线性的前提下最小化通孔数量有利于节约制造成本.此外,随着集成电路的规模日益增长,需要处理的线网数量显著增多,层分配算法运行时间增大成为限制高效设计布线方案的重要制约因素.因此,提出了一种高效的基于区域划分的并行策略,使各区域在并行布线阶段负载均衡,以提高并行布线的效率.同时设计一种基于线网等效布线方案感知的通孔优化策略,决定各线网对布线资源使用的优先级,进而有效地减少层分配方案的通孔数量.所提出的基于线网等效布线方案感知的通孔优化策略和基于区域划分的并行策略能够有效结合,同时优化通孔数量和运行时间,以实现层分配效率和质量的同步提高.多组实验测试的结果表明该算法能够有力优化通孔数量并同时缩短运行时间,具有很好的优化性能.
提交时间:2020-08-10
3. 对四端忆阻器的建模及其电路仿真
摘要: 本文在传统二端忆阻器的基础上,提出了一种四端忆阻器的仿真模型.该器件的4个端口分别对应于MOS晶体管的栅、源、漏、衬底四个极,可以代替数字电路中的MOS晶体管来实现电路功能.本文用该模型构建了与非、或非等逻辑门电路、1bit数据的1R-1R读写电路,在仿真层面实现了四端忆阻器在数字电路和存储器方面的简单应用.相比于MOS晶体管,四端忆阻器在小尺寸、低功耗等方面具有更大的优势.在CMOS工艺尺寸渐渐趋于极限的今天,对四端忆阻器的应用是一个具有一定合理性的前进方向.
提交时间:2020-08-10
4. 基于多磁畴铁电晶体管模型的一种高存储密度的二铁电晶体管三态内容寻址内存设计
摘要: 随着以数据为中心的应用程序的数量不断增长,研究人员正在寻找共置逻辑和存储元素的方法,以改善面积、能耗和延迟.三态内容可寻址存储器(TCAM)作为一种存内逻辑(LiM)运算器件,目前广泛用于路由器,高速缓存和高效的机器学习模型中.从技术前景来看,研究人员已开始考虑使用各种非易失性(non-volatile,NV)存储器技术来设计NV TCAM.与传统的CMOS设计相比,它们可以改善诸如能量和延迟等品质因数(figure of merit FOM).在这些器件中,铁电场效应晶体管(FeFET)凭借其高ON I与OFF I比,高效的电压驱动写入机制,低成本和与CMOS兼容的制造工艺而脱颖而出,基于最新经过实验校准的FeFET模型提出2FeFET TCAM设计.在单元和阵列级别评估了我们的设计,并与其他TCAM进行比较.我们的结果表明,2FeFET TCAM的写入能量分别比用CMOS或ReRAM构成的TCAM少3.5倍和3200倍.单元面积是CMOS TCAM的13%,与ReRAM设计相当.2FeFET TCAM的搜索能量延迟乘积(EDP)分别也比CMOS和ReRAM TCAM小4.1倍和2.8倍.
提交时间:2020-08-10
5. 基于混合拓扑优化和启发式搜索的VLSI高质量总体布线算法
摘要: 总体布线是超大规模集成电路物理设计极为重要的一部分,影响芯片的良率以及质量.为了提高总体布线结果的质量和效率,提出了两种有效的加强策略,包括:(1)一种结合普里姆算法和分治法的混合拓扑优化策略.(2)一种同时考虑拥塞和线长的启发式搜索算法.本文通过采用普里姆算法和分治法的有效结合构建线网的拓扑结构,避免了FLUTE算法构建线网拓扑结构时,引入过多斯坦纳点造成拥塞过度集中的问题.另外,在拆线重布阶段,使用同时考虑拥塞和线长的启发式搜索算法,以进一步对布线结果的总线长进行优化.实验结果表明,所提两个策略在总溢出数、总线长以及平均运行时间这三个重要的评价指标上均取得有效的优化.
提交时间:2020-08-10
6. 基于加速交替方向乘子法的并行磁共振成像研究
摘要: 并行磁共振成像技术是医学成像领域的重要突破.如何提高成像质量、缩短成像时间是并行磁共振成像算法研究一直关注的热点.本文提出一个加速交替方向乘子法,有效避免成像中测量矩阵繁琐计算,提高成像效率.算法在传统交替方向乘子法中引入对称性思想,从提高算法性能出发,在更新中增加一个对偶变量更新的步骤,同时将对偶变量步长范围扩展为大于1的大步长.在子问题求解过程中,借助线性近似技巧有效避免了繁琐的计算,通过修正的Barzilai-Borwein(BB)可变步长策略,提高了算法收敛性能.数值结果表明本文提出的加速交替方向法具有良好的图像恢复功能和收敛性质.
提交时间:2020-08-10
7. 基于快速傅里叶变换的卷积神经网络加速器设计
摘要: 卷积神经网络(CNN)已被证明超过90%以上的计算是在卷积层完成的,因此卷积层的加速方案对整个卷积神经网络的效率和性能来说有着至关重要的影响.卷积层的乘累加方式会因加法树的存在而限制并行性,严重影响了CNN的计算时间.众所周知,频域点乘结果与时域卷积结果是相等的.对于快速傅里叶变换(FFT)这种频域转换算法来说,不仅可并行度高,而且大大减少了卷积计算.但由于CNN的特性(输入特征图与卷积核尺寸相差较大),会导致FFT算法效果不明显.所以本文将重叠相加法运用在卷积层上,以加快CNN的运行.另外,采用高层次综合(HLS)的方法将CNN快速部署在FPGA平台上,并提出了一套数学方法去选择Overlap and Add(OaA)的尺寸.本文在VGG-16模型下,OaA卷积比时域卷积周期快了近8.5倍.
提交时间:2020-08-10
8. 基于深度学习的可布线性驱动布局算法研究
摘要: 随着深度学习的快速发展,将深度学习思想和算法应用于EDA领域成为当前研究的热点.超大规模集成电路的布局过程是集成电路物理设计的重要步骤,且布局结果的可布线性会对之后的布线过程产生重要影响.本文在开源的DREAMPlace框架的基础上,提出并实现了一种基于深度学习的可布线性驱动布局算法DrPlace.在总体上,设计并实现了基于深度学习的可布线性驱动布局器的整体框架,集成了可布线性驱动的总体布局、可布线性驱动的合法化和详细布局.在总体布局过程中,深入分析线长函数和单元密度函数并加入了引脚密度函数,实现了引脚密度的关键内核.在对比实验中,DrPlace布局器与DREAMPlace布局器相比在可布线性上获得了提升.
提交时间:2020-08-10
9. 基于自适应模板的深度学习FPGA训练加速框架设计
摘要: 深度学习算法的成功部署依赖强大的算力支撑,尤其是模型的训练需要大量的硬件资源和时间.用FPGA加速深度学习算法是当下的热门方向,然而这通常需要较长的开发周期和丰富的硬件设计经验.为了应对这一挑战,本文设计了一种基于自适应模板技术的深度学习算法FPGA训练加速框架.本文首先分析了深度学习算法硬件加速的可行性.基于现有的机器学习加速平台,在应用规模、并行调度策略、资源使用和功能扩展上进行了深入的研究并提出了相应的优化策略.本文采用CPU-FPGA异构加速模板技术,提出了自适应的上层模型编译框架实现与不同硬件加速资源的适配.这种基于定制模板的软硬件协同设计可以很好的适配不同的FPGA芯片并支持算法的快速迭代.作为应用案例,利用所提的训练加速框架,针对图神经网络学习算法实现了与CPU相比7~41倍的速度提升.
提交时间:2020-08-10
10. 基于FPGA的Darknet网络硬件加速器设计
摘要: 本文提出了一种基于二维脉动阵列架构的全并行、高吞吐量卷积神经网络硬件加速器.针对卷积层网络架构的不同,阵列架构统一由基于多组卷积核的二维行阵列组成,并相应地设计了行阵列间高效的数据重用算法,该方法可以减少66.3%的数据访问,从而极大降低硬件加速器的功耗.为了进一步改进计算带宽和能耗问题,本文实现了一种卷积与池化一体化的运算方式以便减少中间数据的存储空间.本文利用Pytorch框架,实现了Darknet网络对CIFAR10数据集的分类,分类精度为89.56%.通过VC709开发板进行实验验证,所提出的加速器在200MHz时钟频率下可以达到307.1GOPS的峰值性能.
提交时间:2020-08-10
11. 基于LLVM的Verilog编译型模拟方法
摘要: 在用HDL(Hardware Description Language,硬件描述语言)设计硬件时,模拟仿真是设计周期中保证HDL满足开发者意图的重要一环.事件驱动型模拟是被认为最有效的仿真方式,然而,目前执行事件驱动型模拟的仿真工具生成目标代码的过程较为繁琐:将HDL代码翻译为C++等软件语言,再与用同样软件语言编写的事件调度器混合编译得到目标代码.由于包含额外的中间步骤,效率有较大的提升空间.本文提出一种基于LLVM的Verilog编译型模拟方法,为Verilog语言设计了一种新颖、易于生成的非线性的行为级中间表示.这种中间表示可以直接被转化为LLVM IR,再通过LLVM后端输出成可链接的目标文件,最终得到可执行文件.本文提出的模拟方法避免了C++等高级语言代码生成,节省了编译时间.实验结果表明,与经典模拟方法相比,本文提出的模拟方法有效节省了编译时间,同时具有较高的运行效率.
提交时间:2020-08-10
12. 基于RISC-V的服务器管理控制器原型设计
摘要: 服务器管理控制器是云计算装备关键部件之一,目前主要基于ARM架构开发,ARM较高的授权费推高了控制器设计成本,不利于SoC相关产品的迭代和升级.RISC-V是近年提出的一种开源的处理器架构,与ARM同属精简指令集,具有模块化、可扩展等诸多特点.本文采用RISC-V处理器架构(BOOM V2),设计实现了一种基于RISC-V处理器的服务器管理控制器SoC原型系统.该原型系统基于Xilinx的Virtex Ultra Scale440FPGA进行了构建,完成了实际应用场景下的功能测试和CoreMark测试,结果显示处理器性能提升了26%,优于同级别的ARM核心,系统功能符合设计预期.此外,本文基于OpenBMC实现了IPMI等专用管理控制协议,基本功能验证通过,证明了通过RISC-V替换ARM优化SoC架构的可行性.
提交时间:2020-08-10
13. 开源处理器敏捷软硬件协同验证基础平台实现
摘要: 当下信息产业热点之一的AIoT(Artificial Intelligence of Things,人工智能物联网)需要使用专用硬件加速架构对应用算法加速,带来了定制化芯片开发的需求.AIoT芯片使用的处理器包括通用处理器和专用处理器.采用商业授权的处理器通常会带来很高的成本,而开放源代码的处理器设计,即开源处理器,提供了无需授权的低成本方案.基于开源处理器的芯片设计通常具有的特点包括面向AIoT碎片化应用场景、软硬件深度协同加速,这些特点决定了开源处理器芯片设计在投片前,需要基于近似真实的硬件环境,敏捷地进行软硬件系统定义、集成和试错.本文为支持敏捷的软硬件协同验证技术,构建了一套基于SoC FPGA和开源RISC-V架构的开源处理器敏捷软硬件协同验证平台,支持开源处理器软硬件栈,能够启动Linux发行版操作系统.
提交时间:2020-08-10
14. 开源项目openGPU1.0
摘要: 本文介绍了一个开源项目openGPU1.0.鉴于目前国内GPU的研发资源匮乏,处于十分落后的状态,本项目旨在于引起各方面的重视,推动国内GPU的研究与发展.因为资源有限,openGPU1.0采用了较为简单的openGL-ES1.0Lite的3D标准,但还是一条完整的图形管线.虽然整体较为简单,openGPU1.0还是采用了一些自主创新的设计,如多格式数据通道,微程序命令解析,快速迭代除法器,高性能片上cache,分块分层次遍历光栅化方法等.目前已经完成了openGPU1.0的整个设计,大部分模块都完成了RTL的实现和验证,行将开始系统整合,预计今年9月开始进行FPGA验证.
提交时间:2020-08-10
15. 可调可重构的环形振荡器物理不可克隆函数
摘要: 针对环形振荡器物理不可克隆函数均匀性与独特性不够理想的问题,提出了一种可调可重构环形振荡器物理不可克隆函数设计,该设计包含可重构环形振荡器模块,整合器模块和裁决器模块.可重构环形振荡器模块由多个独立且具有相同设计的可重构环形振荡器-计数器组构成,芯片各部分的工艺偏差由计数器的数值反映;整合器模块通过将多个计数器数值进行排序并依次做差,以减弱芯片固有时延对物理不可克隆函数均匀性与独特性的影响;裁决器模块经预先设计阈值后,对整合器模块产生的差值进行裁决,产生最终的响应.实验结果表明,在FPGA上实现的可调可重构环形振荡器物理不可克隆函数,其均匀性的平均值为49.36%,独特性的平均值为47.07%,均趋于50%的理想值,取得了一定效果.
提交时间:2020-08-10
16. 可重配置多指针弹性缓冲器设计方法研究
摘要: 弹性缓冲器被广泛应用于高速接口协议物理层设计中,用以匹配跨时钟域传输时因时钟相位频率偏差导致的数据同步问题.本文在分析多种接口协议需求的基础上,采用常半满机制,设计并实现了一款参数可配置的多路指针弹性缓冲器.该弹性缓冲器支持10bit、20bit和40bit数据位宽,最小深度为8,最高读写时钟频率为500MHz,通过半满检查方式确定当前存储器内部状态,并以此自动增添或删减控制字符实现缓冲控制.仿真结果表明,本文所设计的弹性缓冲器可以满足多种协议的需求,实现信道数据传输速率的动态匹配.
提交时间:2020-08-10
17. 面向100Gbps网络应用的RISC-V CPU设计与实现
摘要: RISC-V作为新一代开源精简指令集,具有功耗低、面积小和性能高的优点.凭借着巨大的优势,RISC-V CPU技术和产品发展迅速.然而作为全新的指令集架构,目前基于RISC-V架构的中高端64位CPU设计实例很少,绝大多数设计和实现属于32位嵌入式应用,相应的商用IP也缺乏,如在面向高速网络应用方面,几乎找不到设计参考.在本文中,面向高速网络应用,首先改进了开源的64位RISC-V CPU,增加了总线宽度和L2CACHE,然后在CPU中实现了完整的100Gbps以太网IP,包括MAC、PCS和PMA等模块,最后通过仿真、FPGA运行操作系统,验证了所设计的64位RISC-V CPU以及100Gbps以太网IP的正确性和有效性;所设计的RISC-V CPU和100Gbps以太网IP可应用于智能网卡等数据中心应用场景.
提交时间:2020-08-10
18. 面向功耗优化的CMOL电路容错映射
摘要: 针对CMOS/纳米线/分子混合电路(CMOL)的缺陷导致电路功耗增加这一问题,提出基于单元限用的容错映射方法.首先建立缺陷对功耗的影响模型,分析常连缺陷对的多种映射模式对功耗的影响;接着通过高功耗单元的限用与功耗约束的设置来避免相关映射模式的发生;最后采用遗传算法完成电路容错映射.利用ISCAS标准测试电路对本文方法进行验证,实验表明提出方法在成功容错的基础上有效降低了电路功耗,同时对求解速度与电路面积也有较好的优化.
提交时间:2020-08-10
19. 面向敏捷硬件设计的符号模拟器设计与实现
摘要: 敏捷硬件设计方法中,RTL建模常使用自定义的描述语言,为设计验证带来了新挑战.符号模拟技术是(限界)模型检验、等价性检查等验证的基础,为探讨敏捷硬件设计方法中的验证技术,本文针对PyRTL语言及其中间格式,设计实现了一个符号模拟器.本文介绍了符号模拟器的设计原理、转换规则等关键技术.实验结果表明了所实现的符号模拟器的正确性.
提交时间:2020-08-10
20. 面向FPGA后端的神经网络编译工具链
摘要: 随着神经网络在嵌入式和终端设备的广泛使用,边缘计算等特定应用的功耗和性能优化成为业界关注的重点.FPGA因其高并行度、高能效比、可重构、可定制等优点,逐渐被嵌入式神经网络应用开发者采用.然而,传统的FPGA编程技术逐渐无法满足嵌入式应用快速迭代的开发需求,这也限制了FPGA在嵌入式神经网络应用领域的发展.一些研究者尝试打通语言层次间的障碍,实现端到端流程.Xilinx的Vitis平台面向特定的机器学习框架进行优化,使得神经网络模型适配于Xilinx FPGA;LeFlow则对Python的编译过程进行处理,使其中间结果能够直接用于高层次综合过程.然而,已有研究工作都是针对Xilinx等国外厂商的芯片,缺乏针对国内自主研发芯片的支持.本文提出一套完整的面向国产FPGA后端的通用神经网络编译工具链,包括开发者友好的Python前端以及完整的FPGA后端开发流程,可以将开发者从繁琐的硬件编程工作中解放出来,提升嵌入式神经网络应用的开发效率.本文的主要贡献包括:(1)提出一套完整的国产FPGA神经网络编译综合工具链;(2)总结出高层次综合友好的代码规范,并基于此规范提出基于算子模板的代码生成算法;(3)针对FPGA存储资源的多样性,提出一种自适应的内存优化算法,将运算数据合理分配到FPGA不同的存储资源上,有效提升神经网络应用在FPGA后端的吞吐率和资源利用效率.实验结果表明,本文提出的神经网络编译综合工具链在保证FPGA后端正确运行的基础上,比经典编译框架生成的代码减少约64%的触发器资源,同时,本文提出的内存优化算法比常规内存分配方法可以达到约21.8%的性能提升.
提交时间:2020-08-10
- 1
- 2