加入 NexaStar.AI,共同打造世界级具身智能数据基础设施
负责B端SaaS平台后端架构设计与开发迭代,基于FastAPI/Go技术栈搭建高性能、高可用的后端服务体系。
主导多租户架构设计与落地,实现租户数据隔离、权限隔离、资源隔离,支撑平台多企业客户同时接入使用。
负责计费系统核心模块开发与迭代,包含计费规则配置、用量统计、账单生成、续费退费、权限联动计费等核心功能。
参与SaaS平台接口开发、性能优化、数据库优化,保障平台高并发、高稳定运行,提升租户使用体验。
对接前端、产品、运维团队,完成需求拆解、方案设计、功能开发、联调上线与问题复盘,保障业务高效迭代。
梳理后端开发规范、接口文档,搭建通用工具组件,提升团队开发效率,支撑业务规模化拓展
- 负责大模型、机器人模型的分布式训练架构设计与落地,基于PyTorch DDP/FSDP框架优化分布式训练流程,提升模型训练效率与稳定性。 - 主导GPU集群调度体系优化,搭建高效、稳定的算力调度平台,合理分配集群资源,解决算力瓶颈、资源闲置等问题。 - 负责NCCL通信优化、多机多卡训练通信调优,解决分布式训练中的通信延迟、梯度同步异常、负载不均衡等核心问题。 - 优化模型训练全链路性能,包括显存优化、计算加速、断点续训、容错机制搭建,降低大模型、超大模型训练成本。 - 搭建分布式训练标准化工具链、监控体系与运维规范,实现训练任务自动化调度、实时监控、异常告警与快速恢复。 - 跟进分布式训练、算力调度前沿技术,持续迭代架构方案,支撑公司大模型、具身智能模型的规模化训练需求
- 负责机器人全场景数据处理工作,主导ROS Bag数据的解析、清洗、筛选、脱敏、结构化转换等全流程工作,搭建标准化机器人数据处理流程。 - 负责机器人相机、激光雷达、IMU等各类传感器的标定工作,完成内参、外参标定与参数优化,保障传感器数据采集精度与可靠性。 - 针对机器人多传感器时序数据,完成时间对齐、空间对齐、数据融合等处理工作,解决时序错位、数据噪声、帧丢失等问题,输出高质量训练数据集。 - 搭建、迭代机器人数据采集、处理、标注、质检自动化工具链,提升数据生产效率,满足算法模型持续迭代的数据需求。 - 配合算法团队完成数据需求对接,根据模型训练反馈优化数据筛选标准与处理规则,持续提升数据集质量与适配性。 - 梳理数据处理流程规范,输出技术文档,沉淀标准化数据处理工具与模板,支撑规模化项目复用
- 负责具身智能领域VLA视觉语言动作模型、World Model世界模型的算法研发、训练优化与迭代落地,搭建适配机器人场景的通用智能感知与决策模型体系。 - 主导Sim2Real仿真到现实的迁移算法研发,解决仿真环境与真实机器人场景的域偏移问题,提升模型在真实物理场景的泛化能力与执行精度。 - 基于ROS平台完成机器人智能算法的部署、调试与适配工作,对接机器人运动控制、感知、决策模块,实现模型算法与硬件设备的深度融合。 - 跟进具身智能、大模型落地机器人领域的前沿技术,针对人形机器人、移动机器人等场景进行算法创新与优化,持续提升机器人自主交互、自主执行能力。 - 配合产品、硬件团队完成智能机器人功能迭代,输出算法方案、技术文档与落地复盘报告,保障项目高效推进。
负责 UMI/真机数据采集流水线搭建与运维,确保多源异构设备数据采集的稳定性与质量。
负责分布式训练平台架构设计与开发,支撑大规模 VLA/VLM 模型的训练与调优。
负责众包采集网络运营与质量管控,管理分布式采集团队,确保数据产出符合质量标准。
VLA/VLM 模型研发与优化,探索具身智能前沿算法,推动模型在真实机器人场景中的落地应用。
负责客户拓展与合作伙伴关系维护,推动数据采集合作及平台产品在行业内的商业化落地。
负责数据平台前端与后端开发,构建高性能、可扩展的数据管理与可视化系统。
投递方式:请将简历发送至 hr@nexastar.cn
邮件标题请注明 【应聘+岗位名称+姓名】,我们将在 5 个工作日内回复。