课题组论文 RoboSafe 荣获 ICLR 2026 高效空间推理研讨会最佳论文奖(Outstanding Paper)。
《RoboSafe:通过可执行安全逻辑保护具身智能体》提出一种神经符号框架——将自然语言安全规则编译为可执行逻辑,在运行时实时监控并约束具身智能体的行为。
YY 杨耀东,北京大学人工智能研究院研究员(博雅青年学者)、院长助理,PAIR-Lab 负责人,北大—灵初智能联合实验室首席科学家。研究方向为人工智能对齐——使智能体可靠地实现人类意图——涵盖三个层面。(1)智能体之间的对齐:多智能体强化学习与博弈论,通过平均场多智能体强化学习、异构智能体信赖域方法、基于 PSRO 的种群学习与安全多智能体优化,使大规模学习智能体群体趋向合作且满足约束的行为。(2)人与模型之间的对齐:大模型后训练,包括面向约束后训练的 Safe RLHF 框架、BeaverTails 偏好数据集、Aligner 纠错模型,以及 ACL 2025 最佳论文《语言模型抵抗对齐》——刻画了对齐后模型向预训练分布回退的弹性现象。(3)与物理世界的对齐:具身智能,包括 Bi-DexHands、UniDexGrasp 灵巧操作基准与策略,面向安全约束机器人基础模型的 Safe VLA,以及与逆矩阵科技合作研发的虚实对齐世界模型。约束优化与博弈建模是贯穿三者的共同方法基础。
在 Nature Machine Intelligence、Matter、AIJ、JMLR、TPAMI 等期刊和会议发表论文三百余篇,谷歌学术引用逾 19,000 次(h-index 60);自 2022 年起位列 CSRankings 北大 AI/ML 方向首位,入选 Scopus 全球前 2% 顶尖科学家。五次获最佳论文级奖项(ACL 2025 最佳论文奖、UKRI AI 2026 年度最佳论文、ICCV 2023 最佳论文入围、CoRL 2020 最佳系统论文奖、AAMAS 2021 最佳前瞻性论文奖),入选国家级优秀青年人才、中国科协青年托举计划、国家人社部高层次留学人才,获麻省理工科技评论「AI 100 青年榜」、福布斯中国 2025 科创革新力人物、吴文俊人工智能科技进步奖。
论文之外,其开源工具 Safe-RLHF、OmniSafe、MARLlib、Bi-DexHands 被全球研究组广泛使用;通过校企联合实验室孵化了灵初智能(具身基础模型)、逆矩阵科技(世界模型)两家独角兽企业,并主持国家自然科学基金、科技部、北京市科委项目五十余项。主讲《大语言模型基础与对齐》《多智能体系统》课程,获北京大学教学成果奖、全国计算机教学案例大赛奖;指导学生获北大五四奖章、校长奖学金、年度人物,以及腾讯混元、商汤奖学金。
现任 ICML、ICLR、NeurIPS、AAAI、IJCAI、AAMAS、IROS 等会议(资深)领域主席,TMLR、Neural Networks、Scientific Reports 期刊编委。加入北大前,曾任伦敦国王学院助理教授、华为英国研究所主任研究员、美国国际集团高级经理。本科毕业于中国科学技术大学,硕士毕业于帝国理工学院,博士毕业于伦敦大学学院,获校唯一提名角逐 ACM SIGAI 优秀博士论文奖。
头条新闻 · 媒体专题 · 最近动态
《RoboSafe:通过可执行安全逻辑保护具身智能体》提出一种神经符号框架——将自然语言安全规则编译为可执行逻辑,在运行时实时监控并约束具身智能体的行为。
北京大学的数学家们利用人工智能和强化学习技术探索亲吻数问题,在高维空间中突破了人类认知。
北大-灵初联合实验室联合发布的通用世界动作模型,面向具身智能体,在空间推理基准上取得 SOTA。
论文揭示后训练对齐的大模型存在"抗改造"基因,现有对齐范式面临失灵预警,为 RLHF 与安全对齐提供新视角。
ICML 2025 线上特邀 3 小时 tutorial,系统讲解 RLHF、DPO、安全对齐、偏好学习与超级对齐。
跨学科工作——将大模型应用于碳纳米管的自主实验合成,发表于 Cell Press 旗舰材料期刊《Matter》。
华人首篇多智能体强化学习 Nature 子刊论文,算法可扩展至上千节点的网络化智能体,已在真实场景中部署。
Xinhua 新华社
NSFC 国家自然科学基金委
MIT Tech Review 麻省理工科技评论
Science & Tech Daily 科技日报
China Youth Daily 中国青年报
People's Daily 人民日报 CNCC 2024 特邀报告《大模型能否对齐?》
发布《AI Alignment Survey》对齐综述
TorchOpt 正式加入 PyTorch Ecosystem
NeurIPS 2022 MyoChallenge 冠军(1 / 340)
TorchOpt 与 Bi-DexHands 开源发布
五个研究方向 · 算法 · 基准 · 代表性工作
围绕 RLHF、偏好学习、安全对齐、红队评估与可解释性,让大模型在能力提升的同时持续保持有益、无害与可信。
以强化学习驱动双手灵巧操作、视觉-语言-动作模型与仿真到真实迁移,构建能在真实物理世界达到人类水平灵巧度的通用具身智能体。
研究合作与竞争多智能体强化学习的博弈理论基础与可扩展算法,覆盖策略梯度、纳什均衡到种群级训练方法。
研究面向大模型智能体的策略学习与对齐,涵盖谈判、共识、宏观经济建模与统一物理-社会动力学的世界模型。
将强化学习与大模型用于数学、医学、物理与材料等科学问题,成果发表于 Nature、Cell 子刊等顶级期刊。
最佳论文 · 人才项目 · 学术荣誉 · 竞赛产业
Efficient and Scalable Reinforcement Learning for Large-Scale Network Control · 发表于 Nature Machine Intelligence
Language Models Resist Alignment: Evidence From Data Compression
UniDexGrasp: Universal Robotic Dexterous Grasping via Learning Diverse Proposal Generation and Goal-Conditioned Policy
Diverse Auto-Curriculum is Critical for Successful Real-World Multiagent Learning Systems
SMARTS: An Open-Source Scalable Multi-Agent RL Training School for Autonomous Driving
国家级青年人才· NSFC
人力资源和社会保障部 · 全国 30 人
中国科学技术协会
全球学术影响力前 2%
麻省理工科技评论「AI 100 青年先锋」
福布斯中国科创革新力人物
ACM SIGAI China · 年度 3 位
世界人工智能大会 · 年度 10 位
吴文俊人工智能科学技术奖 · 科技进步奖二等奖 — 知识增强的可信多模态交互关键技术及应用
中国气象服务协会 · 技术发明一等奖 — 融合北斗与人工智能的极端大风气象应急救援导航路径规划技术研究
机器人灵巧操作竞赛 · 1 / 340 队伍夺冠
数字中国创新大赛人工智能赛道全国一等奖
北大最高学生荣誉 · 腾讯 / 商汤奖学金 · 国自然基金
2026 届两位本科生(邱天异、陈博远)荣获北京市优秀毕业生。
获奖课程:《大语言模型基础与对齐》
获奖案例《多智能体交互决策:理论、算法与大模型时代的实战开发》,依托北大人工智能专业核心课程《多智能体系统》。CCEC 2026 大会颁发。
2025 数字中国创新大赛 · 人工智能高校赛道全国一等奖
2025 年度 · 北京大学
元培学院 2022 级"通班"班主任 · 教学委员
连续三年获此称号(2023 · 2024 · 2025)
代表作 · 按主题筛选
领域主席 · 编委 · 大会主席
中科大 · 帝国理工 · 伦敦大学学院 · AIG · 伦敦国王大学 · 北大
RLHF / DPO / Safe-RLHF · 奖励建模 · 可解释性 · 多模态 & 多语言安全。把对齐理论落到大规模实践。
高自由度灵巧操作的 Sim-to-Real 策略学习;面向物理世界的具身基础模型。与灵初智能科技联合实验室合作开展。
面向物理与社会动力学的世界模型;模拟器与真实世界的对齐用于下游策略训练。与逆矩阵科技联合实验室合作开展。
基本功优先 —— 四步路径,完整清单折叠在后。
我们更看重数学、代码与写作的基本功,而非论文数量。加入前,请先走完这条路。
PAIR-Lab 同时招收 硕士生、访问学生、本科科研实习生与博士后。若你对强化学习、大模型对齐、多智能体或具身智能感兴趣,并致力于构建安全可信的通用人工智能——欢迎在阅读上方入门材料后与我联系。