采用资格迹的神经网络学习控制算法

来源 :控制理论与应用 | 被引量 : 0次 | 上传用户:Bo_Gao
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
强化学习是解决自适应问题的重要方法,被广泛地应用于连续状态下的学习控制,然而存在效率不高和收敛速度较慢的问题.在运用反向传播(back propagation,BP)神经网络基础上,结合资格迹方法提出一种算法,实现了强化学习过程的多步更新.解决了输出层的局部梯度向隐层节点的反向传播问题,从而实现了神经网络隐层权值的快速更新,并提供一个算法描述.提出了一种改进的残差法,在神经网络的训练过程中将各层权值进行线性优化加权,既获得了梯度下降法的学习速度又获得了残差梯度法的收敛性能,将其应用于神经网络隐层的权值更新,改善了值函数的收敛性能.通过一个倒立摆平衡系统仿真实验,对算法进行了验证和分析.结果显示,经过较短时间的学习,本方法能成功地控制倒立摆,显著提高了学习效率.
其他文献
河西走廊具有丰富新能源,势必会带动新能源工业的发展,然而新能源工业的发展是以可持续开发和利用自身的新能源为重要依托的。近年来,随着西部大开发战略的实施,尤其是习近平
在桥梁承台大体积混凝土浇筑施工的过程中,常常会因为外界气温的变化、内部水化热温度升高等隐性因素,使得大体积混凝土施工的过程中有裂缝出现。因此对裂缝的控制就变得极其
民营施工企业参与PPP项目,引进优化了先进的施工技术和社会资本,企业可以学习到先进的管理经验,精简优化自身管理结构。参与PPP项目可以改善施工企业融资压力大、资金周转困
对于供配电系统的负荷计算,是在供电容量和供配电设备配置的负荷计算的基础上,立足配电设计手册以及设计规范等,结合工程设计的实际需要,分析供配电系统的负荷特点等[1]。采用合
本实验对海藻配伍甘草后的化学成分变化进行研究,旨在为其“反”或“不反”提供理论依据。
环境监测实践教学是环境学科实践教学的核心环节,是践行新工科教学的重要抓手,是提高学生实践技能、拓展学生专业视野、关注环境实践、树立学以致用工程理念的重要举措。基于
为确保和提升高等教育学位质量,安大略省率先成立大学质量认证委员会。经过约7年的发展,其机制逐渐成熟。大学质量认证委员会的下设机构——评审委员会、审计委员会、质量保
本文简单分析了中国的水资源状况,由于中国河流众多,为了找出更适合中国特色的水资源策略,本文按照国家统计局数据,将中国大陆分为十大流域:松花江流域,辽河流域,黄河流域,海
<正>2015年夏,苏有朋首次执导的青春电影《左耳》,10天票房破4亿元。而该片编剧,正是两次登陆中国作家富豪榜的原书作者饶雪漫。在青春文学领域活跃28年的她,依然乐此不疲地