首页 > 专栏 > 结构之法 算法之道 结构之法 算法之道 共 76 条资讯 Flex-π——比Fast-WAM更快的多流世界-动作模型:可按需融合RGB和“从RGB中获取的3D pointmap和DINO语义”,联合生成潜在的未来视觉特征和动作 Show-Harness——仅凭一个VLM智能体即可操控机器人:12个语义动作单元(前进/旋转/抓取)既是模型的思考语言、又是机器人的物理指令 Video-to-BT——让VLM照着人类示范视频自动构建行为树:必要时人工干预,以解决动态环境下的长时程装配任务 VLA-Precision——用于在线RL的VLA非对称协同自举方法:以人工纠偏行为克隆提速、渐进价值校准稳策、相对优势更新防漂移 LightNav-0——激发VLM的空间智能实现跨本体通用:基于单目RGB与统一token接口,结合时间感知历史压缩、两阶段课程与GRPO在线强化 Zero-WAM——基于人类视频的上下文世界-动作建模:面对未见任务,给一段人类示范视频作为prompt,不微调直接输出对应的机器人未来视频和可执行动作 ReferTrack——“先认出,再跟随”的智能跟随方法:基于 Refer-CoT与TVBI的单目具身视觉跟踪 Facet-0——用价值引导的RL教会VLA精密装配:通过“动作–力觉”的联合预测,让接触可预测、可估值(接触成了动作的后果,价值来定接触那一瞬怎么下手) RoboPocket——从UMI式被动采集到无机器人即时策略迭代:基于iPhone与AR视觉前瞻的实时闭环数采系统(无需离线SLAM后处理) ω-0——用于人形行走-操作的隐空间预测世界动作模型(全身VLA没有的未来视镜):抛弃像素级视频生成,以轻量“未来视觉latent预测”驱动全身动作扩散生成,实现边走边干活 τ0-VLA——具有世界模型“引导测试时计算”的分层机器人模型:首先生成多个子任务候选,然后世界模型预演,最后价值模型评估 Robo-ValueRL——面向离线到在线强化学习的可靠价值估计:同时捕捉全局任务进度和局部动作偏好,先离线预训练,后在线提升 RoboTTT——面向机器人策略的上下文扩展:将TTT集成至VLA中以推理时建立记忆信息,从而将视觉-运动上下文扩展到 8K 个时间步 ABot-AgentOS——具备多模态记忆的通用智能体操作系统:Agent Harness层(含上下文管理和验证系统)、LLM、记忆作为大脑,自主调用下层导航、操作、运控相关的技能 HoloAgent-0——具备三维空间记忆的统一具身Agent框架:Agent自主拆解、规划,且按需调用技能层中的导航、VLA操作、全身运控,以及记忆层中的空间与时间记忆 T-Rex——给VLA带上触觉的灵巧操作框架:先通过人类视频做预训练,再通过富含触觉的中期训练对齐交互,最后利用极少量目标域演示以快速适配下游任务 FurnitureVLA——利用VLA学习长时域双臂家具装配:将装配长时任务拆分为多个子步骤,且提出进度VLA,以预测每个子任务的进度信号,最终实现子任务之间的切换 T-WAM——融合视觉-触觉的世界动作模型:在统一的流匹配框架下联合学习未来视觉预测、触觉形变预测以及动作预测(且在插入透明导管场景中增大触觉的权重) Focus-Then-Contact——跟我之前给一工厂设计的插拔策略不谋而合:先ACT引导到目标区域附近,然后残差RL实施最终插入,且插入过程中视觉提供稠密奖励,必要时人工干预 OpenHLM——全身VLA下的行走-操作:sonic作为运控底层,π0.5作为VLA的初始化策略 1234下一页 » 相关分类 #!/slash/note #UNTAG (B)(F)uzzing on my world (Hi)story (IN)SECURE Magazine Notification (gdb) break *0x972 - 带鱼博客 BeltfishBlog - ./kwaa.dev .NET Blog .Trash /home/rook1e 00's Adventure 0kami's Blog 0x41414141 in ?? () 0x7f Blog 0xRick Owned Root ! 0xd00's blog 1 Byte 1A23 Blog 1A23 Studio 1Link.Fun 1stwebdesigner 251 2BAB 的工程博客 2ch中文网 360 CERT 360 Netlab Blog - Network Securi 38号车评中心 3o米的微博 404 Media