networkmanager-dmenu:实践指南
2026-09-11 3465706
2026-09-11 0
面对实际交付,我看phd-bibliography的重点不在星标,而在这项能力:最优控制、强化学习和运动规划参考资料。一旦进入日常自动化环节,输入边界、依赖和失败处理如果不清楚就很难稳定复用会直接影响交付,这也是我最关心的风险。先用一项范围明确的真实任务完成最小试跑更稳妥;过程中要观察配置时间、输出质量、异常信息和维护痕迹,失败也应能解释原因。整体来看,它适合愿意先做小范围验证并复查原始文档的团队拿来做对照测试,最终决定仍应回到真实结果和维护状态。
参考书目
目录
最优控制:dart:
动态规划
线性规划
REPS 相对熵策略搜索,Peters J. 等人。 (2010)。基于树的规划
ExpectiMinimax 具有机会节点的游戏中的最优策略,Melkó E.,Nagy B. (2007)。Sparse sampling 用于大型马尔可夫决策过程中接近最优规划的稀疏采样算法,Kearns M. 等人。 (2002)。MCTS 蒙特卡罗树搜索中的高效选择性和备份算子,Rémi Coulom,SequeL (2006)。UCT 基于 Bandit 的蒙特卡罗规划,Kocsis L.,Szepesvári C. (2006)。OPD 确定性系统的乐观规划、Hren J.、Munos R. (2008)。OLOP 开环乐观规划,Bubeck S.,Munos R. (2010)。SOOP 连续动作确定性系统的乐观规划,Buşoniu L. 等人。 (2011)。OPSS 稀疏随机系统的乐观规划、L. Buşoniu、R. Munos、B. De Schutter 和 R. Babuska (2011)。HOOT 基于样本的连续 ActionMarkov 决策过程规划、Mansley C.、Weinstein A.、Littman M. (2011)。HOLOP 基于强盗的规划和学习 inContinuous-Action 马尔可夫决策过程,Weinstein A.,Littman M. (2012)。BRUE 马尔可夫决策过程在线规划中的简单遗憾优化,Feldman Z. 和 Domshlak C. (2014)。LGP 逻辑几何规划:基于优化的组合任务和运动规划方法,Toussaint M. (2015)。 AlphaGo 通过深度神经网络和树搜索掌握围棋游戏,Silver D. 等人。 (2016)。AlphaGo Zero 在没有人类知识的情况下掌握围棋游戏,Silver D. 等人。 (2017)。AlphaZero 通过通用强化学习算法自玩掌握国际象棋和将棋,Silver D. 等人。 (2017)。TrailBlazer 在踏上道路之前开拓道路:样本高效的蒙特卡罗规划、Grill J. B.、Valko M.、Munos R. (2017)。MCTSnets 通过 MCTSnets、Guez A. 等人学习搜索。 (2018)。ADI 在没有人类知识的情况下解决魔方问题、McAleer S. 等人。 (2018)。OPC/SOPC 使用 Lipschitz 值进行折扣无限范围非线性最优控制的连续行动规划、Buşoniu L.、Pall E.、Munos R. (2018)。控制理论
PI² 强化学习的广义路径积分控制方法,Theodorou E. 等人。 (2010)。PI²-CMA 通过协方差矩阵适应进行路径积分策略改进,Stulp F.,Sigaud O. (2010)。iLQG 用于约束非线性随机系统局部最优反馈控制的广义迭代 LQG 方法,Todorov E. (2005)。 :octocat:iLQG+ 通过在线轨迹优化合成和稳定复杂行为,Tassa Y. (2012)。模型预测控制
MPCC 基于优化的 1:43 比例 RC 赛车 的自动驾驶赛车,Liniger A. 等人。 (2014)。 | MIQP 集成逻辑约束的自动驾驶最优轨迹规划:MIQP 视角、Qian X.、Altché F.、Bender P.、Stiller C. de La Fortelle A. (2016)。安全控制:锁:
鲁棒控制
Robust DP 鲁棒动态规划,Iyengar G. (2005)。Tube-MPPI 具有稀疏目标信息的基于鲁棒采样的模型预测控制,Williams G. 等人。 (2018)。 风险规避控制
RA-QMDP 不确定性下自动驾驶的风险规避行为规划,Naghshvar M. 等人。 (2018)。StoROO X-Armed Bandits:优化分位数和其他风险、Torossian L.、Garivier A.、Picheny V. (2019)。值约束控制
ICS 驾驶座会空吗?,Fraichard T.(2014)。SafeOPT 采用高斯过程的四旋翼飞行器安全控制器优化、Berkenkamp F.、Schoellig A.、Krause A. (2015)。 :octocat:SafeMDP 使用高斯过程的有限马尔可夫决策过程的安全探索、Turchetta M.、Berkenkamp F.、Krause A. (2016)。 :octocat:RSS 关于安全且可扩展的自动驾驶汽车的正式模型,Shalev-Shwartz S. 等人。 (2017)。CPO 约束策略优化、Achiam J.、Held D.、Tamar A.、Abbeel P. (2017)。 :octocat:RCPO 奖励约束策略优化、Tessler C.、Mankowitz D.、Mannor S. (2018)。BFTQ 预算 MDPs 的 Fitted-Q 算法,Carrara N. 等人。 (2018)。SafeMPC 用于安全探索的基于学习的模型预测控制、Koller T、Berkenkamp F.、Turchetta M. Krause A. (2018)。CCE 用于安全强化学习的约束交叉熵方法,Wen M.,Topcu U. (2018)。 :octocat:LTL-RL 具有自动驾驶概率保证的强化学习,Bouton M. 等人。 (2019)。Envelope MOQ-Learning 多目标强化学习和策略适应的通用算法,Yang R. 等人 (2019)。状态约束控制和稳定性
HJI-reachability 控制安全学习:将扰动估计、可达性分析和强化学习与系统探索相结合,Heidenreich C. (2017)。MPC-HJI 在人机车辆交互的概率规划框架中注入基于可达性的安全保证,Leung K. 等人。 (2018)。Lyapunov-Net 基于安全交互模型的学习,Gallieri M. 等人。 (2019)。ATACOM 约束流形上的机器人强化学习,Liu P. 等人 (2021)。不确定动力系统
博弈论:黑桃:
顺序学习:鞋:
多臂强盗 :_machine:
TS 关于根据两个样本 的证据,一个未知概率超过另一个未知概率的可能性,Thompson W. (1933)。UCB1 / UCB2 多臂问题的有限时间分析、Auer P.、Cesa-Bianchi N.、Fischer P. (2002)。Empirical Bernstein / UCB-V 在多臂中使用方差估计进行探索-利用权衡、Audibert J-Y、Munos R.、Szepesvari C. (2009)。kl-UCB 用于有界随机及超越 的 KL-UCB 算法,Garivier A.,Cappé O. (2011)。KL-UCB Kullback-Leibler 最优顺序分配的置信上限,Cappé O. 等人。 (2013)。IDS 具有异方差噪声的信息定向采样和 Kirschner J.、Krause A. (2018)。语境化
LinUCB 个性化新闻文章推荐的上下文强盗方法,Li L. 等人。 (2010)。OFUL 线性随机的改进算法、Abbasi-yadkori Y.、Pal D.、Szepesvári C. (2011)。最佳手臂识别:肌肉:
Successive Elimination 多臂和强化学习问题的动作消除和停止条件,Even-Dar E. 等人。 (2006)。LUCB PAC 随机多臂中的子集选择,Kalyanakrishnan S. 等人。 (2012)。UGapE 最佳手臂识别:固定预算和固定置信度的统一方法、Gabillon V.、Ghavamzadeh M.、Lazaric A. (2012)。Sequential Halving 多臂强盗中的几乎最优探索,Karnin Z. 等人 (2013)。M-LUCB / M-Racing 最大最小动作识别:游戏的新强盗框架、Garivier A.、Kaufmann E.、Koolen W. (2016)。Track-and-Stop 具有固定置信度的最优最佳手臂识别,Garivier A.,Kaufmann E. (2016)。LUCB-micro 具有固定置信度的结构化最佳手臂识别,Huang R. 等人。 (2017)。黑盒优化:black_large_square:
GP-UCB Bandit 设置中的高斯过程优化:无遗憾和实验设计、Srinivas N.、Krause A.、Kakade S.、Seeger M. (2009)。HOO X-武装匪徒、Bubeck S.、Munos R.、Stoltz G.、Szepesvari C. (2009)。DOO/SOO 确定性函数的乐观优化,无需了解其平滑度,Munos R. (2011)。StoOO 从 Bandits 到蒙特卡洛树搜索:应用于优化和规划的乐观原理,Munos R. (2014)。StoSOO 随机同时乐观优化、Valko M.、Carpentier A.、Munos R. (2013)。POO 平滑度未知的噪声函数的黑盒优化、Grill J-B.、Valko M.、Munos R. (2015)。EI-GP AlphaGo 中的贝叶斯优化,Chen Y. 等人。 (2018)强化学习:机器人:
理论:书籍:
UCRL2 强化学习的近乎最优后悔界限,Jaksch T. (2010)。 ^0.5-橙色)PSRL 为什么后验采样比乐观强化学习更好?,奥斯班德 I.,范罗伊 B.(2016)。UCBVI 强化学习的最小最大遗憾界限、Azar M.、Osband I.、Munos R. (2017)。 ^0.5-橙色)Q-Learning-UCB Q-Learning 是否有效?,Jin C.,Allen-Zhu Z.,Bubeck S.,Jordan M.(2018)。 ^0.5-橙色)LSVI-UCB 通过线性函数逼近证明有效的强化学习、Jin C.、Yang Z.、Wang Z.、Jordan M. (2019)。生成模型
QVI 关于生成模型强化学习的样本复杂性、Azar M.、Munos R.、Kappen B. (2012)。正策梯度
线性系统
OFU-LQ 线性二次系统自适应控制的遗憾界、Abbasi-Yadkori Y.、Szepesvari C. (2011)。TS-LQ 改进了线性二次控制问题中汤普森采样的遗憾界限、Abeille M.、Lazaric A. (2018)。Coarse-Id 关于线性二次调节器 的样本复杂性,Dean S.、Mania H.、Matni N.、Recht B.、Tu S. (2017)。基于价值的:chart_with_upwards_trend:
NFQ 神经拟合 Q 迭代 - 首次体验数据高效的神经强化学习方法,Riedmiller M. (2005)。DQN 使用深度强化学习玩 Atari,Mnih V. 等人。 (2013)。 DDQN 采用双 Q 学习的深度强化学习,van Hasselt H.、Silver D. 等人。 (2015)。DDDQN 用于深度强化学习的决斗网络架构,Wang Z. 等人。 (2015)。 PDDDQN 优先体验重播,Schaul T. 等人。 (2015)。NAF 具有基于模型加速的连续深度 Q 学习,Gu S. 等人。 (2016)。Rainbow Rainbow:结合深度强化学习的改进,Hessel M. 等人。 (2017)。Ape-X DQfD 进一步观察:在 Atari 上实现一致的性能,Pohlen T. 等人。 (2018)。 基于正策:力量:
正策梯度
REINFORCE 用于联结强化学习的简单统计梯度跟随算法,Williams R. (1992)。Natural Gradient 自然正策梯度,Kakade S. (2002)。TRPO 信任域策略优化,Schulman J. 等人。 (2015)。 PPO 近端策略优化算法,Schulman J. 等人。 (2017)。 DPPO 丰富环境中运动行为的出现,Heess N. 等人。 (2017)。 演员评论家
AC 用于函数逼近强化学习的策略梯度方法,Sutton R. 等人。 (1999)。NAC 天生的演员评论家,Peters J. 等人。 (2005)。DPG 确定性策略梯度算法,Silver D. 等人。 (2014)。DDPG 通过深度强化学习进行连续控制,Lillicrap T. 等人。 (2015)。 1 | 2 | 3 | 4MACE 使用深度强化学习的地形自适应运动技能、Peng X.、Berseth G.、van de Panne M. (2016)。 | A3C 深度强化学习的异步方法, Mnih V. et al 2016. 1 | 2 | 3SAC Soft Actor-Critic:使用随机 Actor 进行离策略最大熵深度强化学习,Haarnoja T. 等人。 (2018)。 MPO 最大后验策略优化,Abdolmaleki A. 等人 (2018)。无衍生品
CEM 使用噪声交叉熵方法学习俄罗斯方块、Szita I.、Lörincz A. (2006)。 CMAES 进化策略中完全去随机化的自适应,Hansen N.,Ostermeier A. (2001)。NEAT 通过增强拓扑进化神经网络,Stanley K. (2002)。 iCEM 用于实时规划的高效样本交叉熵方法,Pinneri C. 等人。 (2020)。基于模型的:world_map:
Dyna 基于近似动态规划的学习、规划和反应集成架构,Sutton R. (1990)。PILCO PILCO:基于模型和数据高效的策略搜索方法,Deisenroth M.,Rasmussen C. (2011)。 (讲)DBN 概率 MDP- 汽车行为规划,Brechtel S. 等人。 (2011)。GPS 深度视觉运动策略的端到端训练,Levine S. 等人。 (2015)。 DeepMPC DeepMPC:学习模型预测控制的深层潜在特征,Lenz I. 等人。 (2015)。 SVG 通过随机值梯度学习连续控制策略,Heess N. 等人。 (2015)。 FARNN 使用深度动态神经网络进行非线性系统识别,Ogunmolu O. 等人。 (2016)。 :octocat:BPTT 通过短期预测进行长期规划,Shalev-Shwartz S. 等人。 (2016)。 1 | 2VIN 价值迭代网络,Tamar A. 等人 (2016)。 价值预测网络,Oh J. 等人。 (2017)。DistGBP 基于模型的离散和连续操作规划,Henaff M. 等人。 (2017)。 1 | 2Predictron The Predictron:端到端学习和规划,Silver D. 等人。 (2017)。 MPPI 用于基于模型的强化学习的信息论 MPC,Williams G. 等人。 (2017)。 :octocat: PlaNet 从像素学习潜在动态进行规划,Hafner 等人。 (2018)。 NeuralLander 神经着陆器:使用学习动力学进行稳定的无人机着陆控制,Shi G. 等人。 (2018)。 DBN+POMCP 在高速公路场景中实现自动驾驶车辆的类人预测和决策,Sierra Gonzalez D. (2019)。MuZero 通过学习模型规划掌握 Atari、围棋、国际象棋和将棋,Schrittwiese J. 等人。 (2019)。 :octocat:BADGR BADGR:基于自主自监督学习的导航系统、Kahn G.、Abbeel P.、Levine S. (2020)。 :octocat:H-UCRL 通过乐观正策搜索和规划实现基于模型的高效强化学习、Curi S.、Berkenkamp F.、Krause A. (2020)。 :octocat:探索:帐篷:
Pseudo-count 统一基于计数的探索和内在动机,Bellemare M. 等人 (2016)。 HER 事后经验回放,Andrychowicz M. 等人。 (2017)。 VHER 视觉后见之明体验重播,Sahni H. 等人。 (2019)。RND 通过随机网络蒸馏进行探索,Burda Y. 等人。 (OpenAI)(2018)。 Go-Explore Go-Explore:硬探索问题的新方法,Ecoffet A. 等人。 (优步)(2018)。 C51-IDS 深度强化学习的信息导向探索、Nikolov N.、Kirschner J.、Berkenkamp F.、Krause A. (2019)。 :octocat:Plan2Explore 计划通过自监督世界模型进行探索,Sekar R. 等人。 (2020)。 :octocat:RIDE RIDE:奖励程序生成环境的影响驱动探索,Raileanu R.,Rocktäschel T.,(2020)。 :octocat:层次结构和时间抽象:clock2:
OC Option-Critic 架构、Bacon P-L.、Harb J.、Precup D. (2016)。FuNs FeUdal 用于分层强化学习的网络,Vezhnevets A. 等人。 (2017)。DeepLoco DeepLoco:使用分层深度强化学习的动态运动技能,Peng X. 等人。 (2017)。 | DAC DAC:学习选项的双重 Actor-Critic 架构,Zhang S.,Whiteson S.(2019)。H-REIL 基于强化学习的近似事故驾驶模仿策略控制,Cao Z. 等人。 (2020)。 1,2部分可观察性:眼睛:
PBVI 基于点的值迭代:POMDPs 的随时算法,Pineau J. 等人。 (2003)。cPBVI 基于点的连续值迭代 POMDPs,Porta J. 等人。 (2006)。POMCP 大型蒙特卡洛规划 POMDPs,Silver D.,Veness J. (2010)。MOMDP 意图感知运动规划,Bandyopadhyay T. 等人。 (2013)。DNC 使用具有动态外部存储器的神经网络进行混合计算,Graves A. 等人 (2016)。 social perception 具有社会感知的自动驾驶汽车行为规划,Sun L. 等人 (2019)。转移:earth_americas:
IT&E 能够像动物一样适应的机器人、Cully A.、Clune J.、Tarapore D.、Mouret J-B。 (2014)。 MAML 用于快速适应深度网络的模型无关元学习、Finn C.、Abbeel P.、Levine S. (2017)。 ME-TRPO 模型集成信任区域策略优化,Kurutach T. 等人。 (2018)。 GrBAL / ReBAL 通过元强化学习学习适应动态的现实环境,Nagabandi A. 等人。 (2018)。 IT&E 使用“智能试错”算法学习和适应四足动物步态、Dalin E.、Desreumaux P.、Mouret J-B。 (2019)。 FAMLE 通过模拟先验的元学习嵌入实现机器人技术的快速在线适应、Kaushik R.、Anne T.、Mouret J-B。 (2020)。 PACOH PACOH:具有 PAC- 保证的贝叶斯最优元学习、Rothfuss J.、Fortuin V.、Josifoski M.、Krause A. (2021)。SimGAN SimGAN:通过对抗性强化学习进行域适应的混合模拟器识别,Jiang Y. 等人。 (2021)。 :octocat:多代理:two_men_holding_hands:
Minimax-Q 马尔可夫游戏作为多智能体强化学习的框架,M. Littman (1994)。MILP 移动机器人沿指定路径的时间最优协调,Altché F. 等人。 (2016)。 MIQP 协作半自动驾驶车辆的监督驾驶算法,Altché F. 等人。 (2017)。 SA-CADRL 具有深度强化学习的社交意识运动规划,Chen Y. 等人。 (2017)。 MAgent MAgent:人工智能集体智能的多智能体强化学习平台,Zheng L. 等人。 (2017)。 MPPO 通过深度强化学习实现最佳去中心化多机器人碰撞避免,Long P. 等人。 (2017)。 COMA 反事实多代理策略梯度,Foerster J. 等人。 (2017)。MADDPG 用于混合合作竞争环境的多智能体 Actor-Critic,Lowe R. 等人 (2017)。 :octocat:FTW 通过基于人群的深度强化学习在第一人称多人游戏中实现人类水平的表现,Jaderberg M. 等人。 (2018)。 MAPPO MAPPO 在合作、多代理游戏中的惊人效果,Yu C. 等人。 (2021)。 |:octocat:表征学习
DeepDriving DeepDriving:自动驾驶中直接感知的学习功能可供性,Chen C. 等人。 (2015)。 MERLIN 目标导向代理中的无监督预测记忆,Wayne G. 等人。 (2018)。 1 | 2 | 3 | 4 | 5 | 6FERM 高效机器人操作框架,Zhan A.,Zhao R. 等人。 (2021)。 :octocat:S4RL S4RL:离线强化学习的令人惊讶的简单自我监督,Sinha S. 等人 (2021)。离线
SPI-BB 通过基线引导进行安全策略改进,Laroche R. 等人 (2019)。AWAC AWAC:使用离线数据集加速在线强化学习,Nair A. 等人 (2020)。CQL 用于离线强化学习的保守 Q 学习,Kumar A. 等人。 (2020)。其他
从演示中学习:mortar_board:
模仿学习
DAgger 将模仿学习和结构化预测简化为无悔在线学习、Ross S.、Gordon G.、Bagnell J. A. (2011)。QMDP-RCNN 通过循环卷积神经网络进行强化学习,Shankar T. 等人。 (2016)。 (讲)DQfD 从现实世界强化学习的演示中学习,Hester T. 等人。 (2017)。 GAIL 生成对抗性模仿学习,Ho J.,Ermon S.(2016)。Branched 通过条件模仿学习进行端到端驾驶,Codevilla F. 等人。 (2017)。 | 讲UPN 通用规划网络,Srinivas A. 等人。 (2018)。 DeepMimic DeepMimic:基于物理的角色技能的示例引导深度强化学习,Peng X. B. 等人。 (2018)。 R2P2 用于灵活推理、规划和控制的深度模仿模型,Rhinehart N. 等人。 (2018)。 自动驾驶的应用:汽车:
PS-GAIL 用于驾驶模拟的多智能体模仿学习,Bhattacharyya R. 等人。 (2018)。 :octocat:逆强化学习
Projection 通过逆强化学习进行学徒学习,Abbeel P.,Ng A. (2004)。MMP 最大规划,Ratliff N. 等人。 (2006)。BIRL 贝叶斯逆强化学习,Ramachandran D.,Amir E. (2007)。MEIRL 最大熵逆强化学习,Ziebart B. 等人。 (2008)。LEARCH 学习搜索:模仿学习的函数梯度技术,Ratliff N.,Siver D. Bagnell A. (2009)。CIOC 具有局部最优示例的连续逆最优控制、Levine S.、Koltun V. (2012)。 MEDIRL 最大熵深度逆强化学习,Wulfmeier M. (2015)。GCL 引导成本学习:通过策略优化进行深度逆最优控制,Finn C. 等人。 (2016)。 RIRL 重复逆强化学习,Amin K. 等人。 (2017)。自动驾驶的应用:出租车:
运动规划:running_man:
搜索
Dijkstra 关于与图相关的两个问题的注释,Dijkstra E. W. (1959)。A* 启发式确定最小成本路径的形式基础,Hart P. 等人。 (1968)。取样
RRT* 基于采样的最优运动规划算法,Karaman S.,Frazzoli E. (2011)。 LQG-MP LQG-MP:具有运动不确定性和不完美状态信息的机器人的优化路径规划,van den Berg J. 等人。 (2010)。PRM-RL PRM-RL:结合强化学习和基于采样的规划的远程机器人导航任务,Faust A. 等人。 (2017)。优化
反应性
PF 机械手和移动机器人的实时避障,Khatib O. (1986)。VFH 矢量场直方图 - 移动机器人的快速避障,Borenstein J. (1991)。VFH+ VFH+:快速移动机器人的可靠避障,Ulrich I.,Borenstein J. (1998)。Velocity Obstacles 使用速度障碍的动态环境中的运动规划、Fiorini P.、Shillert Z. (1998)。架构与应用