About me

你好,我是 李爽乐,电子科技大学计算机技术硕士在读。我专注于多模态学习、3DGS 三维重建与空间智能方向的研究,希望让AI像人一样感知、理解并重建三维世界。

科研之外,我还喜欢用足球、乒乓球等运动保持活力;也期待与更多同学交流想法,共同进步!

技能与方向

  • 多模态学习

    跨模态表征学习与语义对齐、时序多模态建模与对齐。

  • 3D 重建与空间智能

    点云处理、视觉 SLAM、3DGS 三维重建与位姿估计。

  • 视觉建模

    多粒度视觉建模:目标检测、实例分割、3D 检测等。

  • 工程能力

    Python / C++、PyTorch、Linux / Shell / Git、ROS / ROS2。

Education

教育经历

  1. 电子科技大学(985)

    2024.09 — 2027.06

    计算机技术 · 计算机科学与工程学院 · 全日制专业硕士

    • 研究方向:多模态学习,第一视角视频理解,多模态融合感知,具身智能,空间感知,3D 重建等。

    • 科研成果:在 ACMMM、CVPR、ICME 等知名国际会议上均发表学术论文;获得 2025 ACMMM 国际会议多模态人机交互错误检测识别大赛冠军(赛道 2,第一参赛人);优秀研究生学业奖学金。

  2. 南京航空航天大学(211)

    2020.09 — 2024.06

    人工智能 · 计算机科学与技术学院 · 工学学士

    • 主要荣誉:优秀毕业设计,多次获学业奖学金一等奖,优秀学生奖学金,校级院际杯足球比赛冠军。

Internship

实习经历

  1. 华为技术有限公司杭州研究所

    2026.06 — 至今

    2012 实验室 · 多模态空间算法实习生 · 研究方向:3DGS 重建与补全

    • 围绕 3D Gaussian Splatting(3DGS)重建后的三维场景展开研究,聚焦场景中关键主体的实例级提取与高质量分离。

    • 设计主体感知的实例分割与抠取流程,从大规模高斯点云中精准分离目标物体,保留几何细节与外观一致性。

    • 对抠取出的主体区域执行物体级 inpainting,重建被遮挡 / 缺失部分,实现单物体级别的几何与纹理优化。

    • 构建模块化修复管线,结合多视角参考与先验信息,显著提升补全质量与渲染保真度,支撑场景编辑、新视角合成等下游任务。

    • 输出可复用算法组件,配合团队完成定量指标评测与可视化验证,推动方案在业务侧落地。

Projects

  • 提示:可先放大后播放

    狗臂协同快递复合本体机器人

    企业横向 · 学生骨干 · 2025.12 — 2026.03

    项目介绍:面向智能快递取件场景,开发基于 UnitreeGO2 四足机器人与方舟无限机械臂协同的移动操作系统,实现四足平台搭载机械臂的复合本体协同作业。

    负责内容:负责方舟无限机械臂视觉抓取模块开发,基于 RealSense D435i RGB-D 相机构建视觉感知系统并完成 Eye-in-Hand 手眼标定,实现相机与机械臂坐标系对齐;结合 YOLO + SAM 进行目标检测与分割,并利用 GraspNet 预测抓取点、夹爪姿态(RPY)及抓取力度,通过 ROS 控制机械臂自主抓取执行。

    项目成果:实现语音驱动的人机交互与多用户语音识别;基于 SLAM 完成室内自主导航与目标点到达;设计任务记忆机制以支持任务中断后的状态恢复;结合视觉抓取模块,实现对外卖、快递、雨伞、饮料等多类物体的自主抓取。

  • 第一人称视角多模态空间感知与建模方法研究

    省部级纵向科研项目 · 学生骨干 · 2025.11 — 2026.02

    项目介绍:面向机器人巡检与移动感知场景,开发拟物体场景感知模块,对运动轨迹中的环境进行实时感知,实现物体识别、3D BoundingBox 估计及物体功能关系建模,构建具备语义理解能力的场景表示。

    负责内容:负责基于 ORB_SLAM3 构建环境轨迹采集系统,实现 RGB-D 数据与相机位姿同步获取;基于多视角 3D 目标检测与框融合算法完成场景物体建模,采用 Qwen3-VL-Plus 构建 SceneGraph 实现场景关系建模。

    项目成果:系统成功部署于四足机器人平台,能够随机器人运动实时感知环境,完成三维场景重建与开放词汇的 3D 物体检测;基于 SceneGraph 构建物体之间的语义与功能关系,实现如“键盘用于电脑输入”等使用关系的表达。

Publications

论文经历

  • PPGED framework

    Online Error Detection with Procedural Probabilistic Graph in Egocentric Video Stream

    ACM MM 2026 CCF-A 学生第一作者

    针对第一视角视频中的在线流程错误检测(EOED)问题,提出 PPGED 框架,利用参数化记忆机制增强在线特征表示,并结合联合概率建模与动作转移图构建实现流程建模,在在线与离线设置下均取得 SOTA 性能。

  • ATOT framework

    Action Transition with Optimal Transport for Egocentric Procedural Error Detection

    ICME 2026 CCF-B 第一作者

    针对第一视角操作视频的流程错误检测问题,提出 ATOT 框架,通过最优传输建模动作转移,并结合分布一致性约束刻画时空依赖,在 EgoPER、HoloAssist、CaptainCook4D 等数据集上取得 SOTA 性能。

  • MiVLA framework

    MiVLA: Towards Generalizable Vision-Language-Action Model with Human-Robot Mutual Imitation Pre-training

    CVPR 2026 findings CCF-A 共同作者

    针对视觉-语言-动作模型(VLA)跨机器人泛化能力受限问题,提出 MiVLA 框架,通过人机动作空间对齐与互模仿预训练实现跨本体迁移,有效缓解真机数据稀缺问题,仅需少量真机数据微调即可显著提升性能,在 RoboTwin 仿真环境和真实机器人任务中完成成功率分别提升约 25% 和 14%。

  • Multimodal alignment framework

    Multimodal Time Series Alignment for Error Detection in Human Robot Interactions

    ACM MM 2025 CCF-A 共同第一作者

    针对人机交互场景中的多模态交互错误检测问题,构建跨模态时间对齐与窗口聚合机制,结合 LightGBM、MiniRocket 进行时序建模,并在训练过程中通过重采样与类别重加权缓解类别不平衡。

Awards

获奖经历

  1. ACM MM 2025 多模态人机交互错误检测识别大赛 · 冠军

    2025

    2025 ACM MM 国际会议多模态人机交互错误检测识别大赛冠军(赛道 2,第一参赛人)。

  2. 优秀研究生学业奖学金

    2025

    硕士期间学业奖学金。

  3. 优秀毕业设计

    2024

    本科毕业设计获评优秀。

  4. 本科期间荣誉

    2020 — 2024

    多次获学业奖学金一等奖、优秀学生奖学金;校级院际杯足球比赛冠军。