职责描述
岗位职责(具体工作内容)工作内容目前业务线上承载多类型运行任务,涵盖CPU算力型、GPU加速型两大类核心任务,各类任务运行时内存占用差异大、资源消耗波动不稳定,极易出现资源分配过剩、内存溢出、资源浪费、任务卡顿等问题。本岗位核心聚焦服务器集群内存资源智能调度优化,依托现有LightGBM回归模型体系,搭建任务内存用量预测体系,实现线上任务内存资源的精准预判、提前分配、动态调度,提升集群资源利用率与线上任务运行稳定性。同时需要配合完成业务数据梳理、数据清洗、数据开发及数据落地相关工作,支撑算法模型迭代与业务落地。工作职责1. 内存用量预测模型迭代优化:负责线上CPU、GPU各类业务任务的内存占用规律分析,基于现有LightGBM回归模型,完成模型特征工程、参数调优、效果验证与迭代优化,提升任务内存使用量预测的准确率。2. 资源调度策略落地支撑:基于模型预测结果,协助梳理不同类型任务的内存资源分配规则,优化动态资源调度方案,规避内存超配、低配问题,降低集群资源冗余率与任务运行故障概率。3. 数据开发与数据治理:负责线上任务运行数据、内存/CPU/GPU资源消耗数据的采集、清洗、统计与梳理,维护业务数据库数据,完成数据规整、指标统计、数据校验等数据开发相关工作,为模型训练、效果评估提供高质量数据支撑。4. 实验验证与文档输出:配合完成模型上线前的测试、线上效果灰度验证,持续跟踪模型预测精度、资源利用率等核心指标,整理迭代日志、技术方案、落地复盘等技术文档。5. 业务协同优化:配合研发、运维团队,对接线上集群调度场景,反馈资源调度问题,协助完成算法策略的线上落地与迭代优化。任职要求任职资格(学历、目标院校、语言、技能、性格等要求)1. 学历专业:本科及以上在读,计算机、软件工程、数据科学、人工智能、统计学、云计算等相关专业,大二及以上均可。2. 算法基础:熟悉机器学习回归算法,熟练使用LightGBM模型,掌握特征工程、模型训练、调优、验证全流程,有量化预测、时序预测、资源调度建模经验者优先。3. 数据能力:掌握基础数据开发技能,熟练使用SQL,熟悉数据库基础原理与操作,能够独立完成数据查询、清洗、统计分析、数据规整工作,有大数据处理经验加分。4. 编程能力:熟练使用Python,熟悉pandas、numpy等数据处理工具库,具备独立数据分析、模型实验代码编写能力。5. 业务认知:了解服务器集群、CPU/GPU任务运行机制、内存资源调度基本概念者优先,有云计算、算力调度、资源优化相关项目经验优先。6. 综合素质:逻辑清晰、细心严谨,具备较强的问题分析与解决能力,主动性强,能够独立推进实验与迭代,有良好的团队协作与沟通能力。加分项* 有机器学习建模、量化预测、数据挖掘相关竞赛或项目经历;* 熟悉Linux开发环境,了解集群调度、容器化部署基本原理;* 掌握Hive、MySQL等数据库实操,有数据开发、数据治理实习/项目经验;* 了解算力资源调度、云原生资源优化相关业务场景。