首页
看点啥
插画图片
首页 科技看点 Awesome-Embodied-AI:实践指南

Awesome-Embodied-AI:实践指南

2026-09-14 0

面对实际交付,我看Awesome-Embodied-AI的重点不在星标,而在这项能力:具身智能研究资源清单,按场景理解、图像、点云等主题整理相关论文与项目,便于跟踪该领域的方法和数据资源。团队若要把它用于研究与论文处理,应先处理来源证据、引用和结论容易脱节,否则试用结果很容易失真。我的评估方法是拿一篇熟悉的论文或研究问题跑完整流程,然后检查证据定位、引用准确性和结论可复核性是否与文档一致。它更像给需要整理研究证据并愿意复核原文的读者准备的可审查方案,是否长期使用应由试跑数据决定。

真棒-体现-AI

场景理解

图片

描述 代码
SAM 细分
YOLO-世界 开放词汇检测

点云

描述 代码
SAM3D 细分
PointMixer 理解

多模式接地

描述 代码
GPT4V MLM(Image+Language->语言) https://arxiv.org/abs/2303.08774
克劳德3号作品 MLM(Image+Language->语言) https://www.anthropic.com/news/claude-3-family
GLaMM 像素接地
全视 像素接地
LEO 3D

数据收集

来自视频

描述 代码
视频机器人
RT-轨迹
MimicPlay

硬件

描述 代码
UMI 两指
DexCap 五指
HIRO 手 交手

生成模拟

描述 代码
MimicGen
RoboGen

动作输出

生成模仿学习

描述 代码
扩散正策
ACT

可供性地图

描述 代码
CLIPort 取放
机器人可供性 接触及接触后轨迹
机器人-ABC https://github.com/TEA-Lab/Robo-ABC
探索何处 从语义相似性中学习的镜头很少
说走就走,互动随心所欲 扩散模型对运动的可供性
AffordanceLLM LLM 的接地功能
环境意识可供性
OpenAD 来自点云的 Open-Voc 可供性检测
RLAfford 使用 RL 进行端到端的可供性学习
一般流程 从视频中收集可供性
PreAffordance 预抓规划
ScenFun3d 3D 场景中的细粒度功能和可供性

LLM 的问答

描述 代码
COPA
ManipLLM
ManipVQA https://github.com/SiyuanHuang95/ManipVQA

语言修正

描述 代码
OLAF
YAYRobot https://github.com/yay-robot/yay_robot

规划自LLM

描述 代码
SayCan API 等级
VILA 提示级别
喜欢(0)

上一篇

android-dev-readme:实践指南

android-dev-readme:实践指南

下一篇

core:实践指南

core:实践指南
猜你喜欢