职责描述
职位描述
参与门店智能场站视觉AI系统的算法研发、训练、调优与部署落地。系统覆盖进门、预检区、接待区、客休区、机电&钣喷工位、EDS车间、洗车/充电区、行车及消防通道等全场景,需实现车品牌识别、车牌识别、工服识别、预检三件套识别、环车检查动作识别、物品摆放整齐识别、操作规范识别、维修动作识别、5S清扫识别、烟火识别、抽烟识别、车辆维修开工/中止/完工识别等数十种视觉AI能力。实习生将深度参与真实业务场景,接触小模型与多模态大模型协同的先进技术架构。
【岗位职责】
1.参与门店真实场景数据的采集方案设计、数据清洗与标注规范制定,针对低光照、密集遮挡、异形角度等长尾难题进行数据增强与质量验收
2.基于PyTorch框架,负责目标检测(YOLO系列)、图像分类、OCR识别等算法的训练、调优与超参数搜索
3.负责小模型与多模态大模型的协同设计与落地,针对门店场景(如低光照、密集目标等)进行模型优化
4.参与基于百度一见平台的算法训练、调优与部署工作,实现“开箱即用”的模型效果
5.将多模态大模型技术应用于视频理解、图文生成等核心场景,解决实际业务中的复杂问题,推动技术落地并产生商业价值
6.负责模型测试与评估,搭建测试集,进行精度、性能、延迟、误报漏报等问题的分析与优化
【任职要求】
1.学历专业:计算机、模式识别、人工智能、自动化、数学等相关专业硕士在读,2027届及以后毕业生
2.算法能力:
-扎实的深度学习基础,精通Transformer、ViT、CLIP、多模态对齐、指令微调等主流技术栈
-深刻理解目标检测(YOLOv5/v8/v9)、图像分类(ResNet/ViT)等经典算法原理,熟悉OCR识别者优先
-熟悉多模态大模型(VLM)、大语言模型(LLM)相关的算法技术,在相关领域有良好的项目经验或研究经验
3.编程能力:熟练掌握Python,熟练使用PyTorch或TensorFlow深度学习框架
4.实习时长:每周至少实习4天,可连续实习3个月及以上
**加分项**
•有工业视觉、安防监控、智慧门店等相关项目经验或实习经历
•有边缘端实际部署经验
•熟悉模型量化、剪枝、蒸馏等轻量化技术,了解ONNX、TensorRT等推理加速框架
•熟悉百度一见平台或有类似视觉AI平台使用经验
•熟悉RTSP视频流处理、FFmpeg或GStreamer基础
•在Kaggle、天池等算法竞赛中取得优异成绩,或发表过CV相关论文(CCF B类及以上)
•对多模态大模型(VLM)在工业场景的落地有强烈好奇心与初步实践经验