说不清条件?直接问一句 →(例:合肥的BMS要几年经验)
要求 云原生 共 746 条 · 其中近一周 15 条 已筛选: 清除
Offboard Infra Engineer 核心职责: · 数据闭环与离线仿真:参与打造业界领先的自动驾驶数据闭环生态系统(Data Flywheel);研发支撑高阶辅助驾驶及端到端大模型应用的大规模云端离线仿真平台等核心基础软件。 · 算法评测与指标体系:设计、构建并持续完善自动驾驶系统的核心评估指标(Metrics)体系与自动化评测平台,助力算法研发的快速闭环与科学度量。 · 云原生与高可用架构:深度参与基于云原生及 Kubernetes 生态的底层架构研发,打造应对海量并发请求、高吞吐、高稳定性的复杂算力调度及业务支撑系统。…
渗透测试 大模型 机器学习 研发(未细分) 机器人 / 智能装备
1. 红队攻防演练(Red Teaming) 主导对企业核心资产、关键业务系统、云基础设施、供应链及员工安全意识的全链路红队攻击演练,模拟真实APT攻击者的战术、技术与程序(TTPs) 设计并执行高级持续性威胁(APT)模拟方案,覆盖外网打点、内网横向移动、权限提升、数据窃取、勒索软件模拟等完整攻击链 定期输出红队演练报告,量化评估企业安全防御体系的检测率、响应时效与阻断能力,提出可落地的加固建议 2. 防御验证与对抗 作为红队核心成员,对现有安全防御体系(EDR、NDR、SIEM/SOC、WAF、零信任架构等)进行实战化验证,发现防御盲区与检测规则缺陷,通过实战对抗持续提升企业整体安全防御…
Python Linux Docker 后端与架构 AI / 大模型
【岗位职责】 1. 根据产品需求,负责 Web 项目后端核心功能的开发和上线; 2. 熟练使用 AI Coding 工具,能够借助AI提升研发效率,同时保证代码质量和系统可维护性; 3. 参与后端技术选型、架构设计讨论,并能根据项目需求引入合适的后端技术和工具; 4. 负责解决性能、稳定性及线上故障等问题,并持续推动系统优化; 5. 能够快速理解和梳理现有系统,具备复杂代码重构、技术债治理能力; 6. 编写和维护必要的技术文档。 【任职要求】 1. 计算机相关专业本科及以上学历,3年以上后端开发经验; 2. 具备扎实的计算机基础知识、软件工程和后端研发能力,有独立负责完整项目或核心模块的经验…
大模型 Go gRPC 算法与AI 通信 / 计算机 / IT
【岗位职责】 1.负责研发AI大模型应用系统的服务端设计和落地,通过架构改进、系统优化等方式提高系统运行效率及稳定性; 2.基于业务规划,能体系化并具有前瞻性的快速输出方案架构以及概要设计文档,跟进方案的详细设计文档和落地; 3.负责关键技术的预研和攻关,编写核心代码,主持攻坚解决各种疑难杂症,快速定位问题并主导相关架构问题的解决。 【技能要求】 1.计算机及相关专业,本科及以上学历,沟通表达良好,1-3年Golang开发经验,基础扎实,良好的抽象思维能力; 2.熟悉grpc相关对的微服务体系,熟悉分布式系统基础设施中常用的技术,如缓存Redis、消息中间件,熟悉云原生架构原理 3.熟悉高并…
分布式 高并发 云原生 后端与架构 通信 / 计算机 / IT
1.架构规划与落地:主导深信服新一代分布式存储产品架构设计与迭代,聚焦文件存储、全闪存储(All Flash)、AI存储三大核心方向,持续优化文件存储架构(如高并发、百亿级小文件处理、跨场景适配),确保产品在文件存储核心场景,AI训练/推理、云原生、HCI、大数据、智算中心等场景下的长期技术竞争力,支撑EB级存储规模与微秒级延迟需求。 2.存储技术突破:负责存储领域技术战略制定与落地,重点攻坚文件存储核心技术(如自研文件系统优化、高并发读写、跨区域共享、数据分级管理)、全闪存储高性能优化(如PCIe 5.0、NVMe-oF、SSD硬件协同优化)、AI存储核心技术(SPDK全用户态存储栈、端到…
岗位职责: 一、架构设计与规划: ①、匹配公司战略,设计和规划整体IT架构及中长期规划路线图,涵盖应用架构、数据架构、技术架构等4A架构,结合行业实践,确保IT与业务发展匹配。 ②、设计高可用架构,编写架构设计文档。对现有系统架构进行定期审计,制定架构设计标准、技术选型标准规范在各业务线的执行情况,识别偏离规划等问题,并推动整改。制定开发管理标准,IT质量管理标准及健康评估等。 二、核心系统开发与优化: ①、主导关键模块设计(如分布式事务、全链路追踪、智能运维告警),解决性能瓶颈(如TPS提升、响应时间优化)。 ②、技术指导。为开发团队提供指导,制定技术治理方案并推动实施,确保遵循架构标准。…
【课题介绍】 本课面向超大尺寸通用大模型规模化的 API 服务场景,基于国产异构算力芯片构建大规模、高性能的分布式推理集群。围绕多级 KVCache、实时动态计算调度、弹性异构基础设施等核心任务,通过工程技术的持续创新,不断追求用户延迟体验、服务成本以及可靠性工程等方面的极致优化,构建高性价比的大模型 API 服务能力,加速形成普惠的token经济。 【课题挑战】 1、大规模发散流量场景下,用户请求动态变化、业务负载高度随机、异构算力瓶颈差异显著、云际异构集群间流量峰谷波动大,在保障用户体验的同时需实现跨集群、跨资源池的全局负载最优分配与潮汐弹性调度,逼近集群吞吐与资源利用率极限;…
Linux Python 数据分析 算法与AI 通信 / 计算机 / IT
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
Linux Python 数据分析 算法与AI 通信 / 计算机 / IT
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
Python 高并发 Docker 研发(未细分) 消费电子
岗位职责 •负责Hermes类智能Agent核心架构设计与开发,搭建Agent自主规划、任务拆 解、迭代执行、自我纠错的完整逻辑链路。 •负责Agent记忆系统研发,设计并实现长短期记忆的存储、智能检索、更新、遗 忘与沉淀机制,解决多轮对话上下文混乱、任务连贯性不足等问题。 •负责Agent工具链编排与集成,实现函数调用、插件管理、多工具串行/并行调 度,对接搜索、代码解释器、文件处理、自动化任务等各类第三方工具。 •落地大模型工程化体系,优化Prompt工程、上下文窗口管理、输出结构化约 束,抑制模型幻觉,提升Agent任务执行准确率与逻辑性。…
分布式 Kubernetes 云原生 后端与架构 AI / 大模型
- 我们正在构建面向下一代大模型的 AI 基础设施。 - 你将深入超大规模 GPU 集群的核心调度链路,解决异构算力管理、复杂工作负载编排、资源效率与系统稳定性等关键问题,为模型训练、推理和持续迭代提供高性能、高弹性、高可用的算力底座。 - 这不是一个以 Kubernetes 运维为主的岗位。我们期待你能够深入调度系统,定义架构、设计机制,并将复杂的基础设施能力沉淀为简单、可靠的工程系统。 职位描述 1. 主导 MiniMax 大模型推理平台与机器学习平台的核心架构设计及演进,构建统一、高效、可扩展的 AI 计算基础设施;…
Docker Kubernetes Linux 研发(未细分) 通信 / 计算机 / IT
工作职责: 1.负责公司业务在主流公有云(AWS、阿里云、Azure 等)上的整体架构设计,确立云原生(Cloud Native)技术路线,保障架构的高可用性与弹性伸缩能力。 2.负责公有云产品的深度调研与技术决策。不局限于厂商宣传,需通过基准测试(Benchmarking)对比不同云厂商在计算(实例规格)、存储(IOPS/吞吐)、网络(带宽/延迟)上的性能差异,给出客观的选型方案。 3.深入研究公有云底层技术原理(如虚拟化技术、计算存储分离架构、云原生网络栈),解决上云后的业务瓶颈及底层技术兼容性问题。 4.负责上云后的性能调优(包括 OS 内核参数、网络优化、存储协议优化等),并建立成本…
大模型 Python Kubernetes 算法与AI 通信 / 计算机 / IT
工作职责 1. 负责大模型服务平台核心功能的开发与建设,包括模型推理部署、模型微调训练、模型蒸馏压缩等关键模块的设计与实现; 2. 持续优化大模型训练推理能力,确保平台在高负载、多机多卡场景下的稳定性和可用性; 3. 集成和维护大模型开发常用工具链,并根据业务需求进行二次开发和功能扩展; 4. 参与平台技术架构的演进规划,推动云原生技术在大模型平台中的应用,提升系统可扩展性和运维效率。 岗位要求 1. 本科及以上学历,计算机、人工智能相关专业,具备2年以上AI基础平台或大模型开发经验; 2. 熟练大模型相关技术栈,包括但不限于vLLM、LLaMA-Factory、Ray等主流工具,具备Pyt…
项目管理 需求分析 微服务 后端与架构 通信 / 计算机 / IT
1、负责对公司业务需求进行深入调研与分析,梳理复杂业务逻辑,将业务需求转化为清晰、可行的系统需求规格说明书。 2、擅长复杂信息系统分析和设计,主导系统的整体架构设计,包括技术架构、数据架构、应用架构等,确保系统架构具有合理性、可扩展性、安全性和稳定性。 3、参与系统详细设计工作,对核心模块的设计方案进行审核与优化,解决系统设计过程中的技术难题。 4、精通主流信息系统架构设计方法和架构(如微服务架构、云原生架构等),制定并完善公司信息系统架构标准与规范,确保架构的一致性和可维护性。 5、跟踪信息系统前沿技术和 AI 技术(如大数据处理技术、机器学习算法、自然语言处理等)的发展动态,评估新技术在…
Linux Python 数据分析 算法与AI 通信 / 计算机 / IT
岗位职责: 1、参与模型、推理框架、硬件平台的 benchmark 设计与回归测试集建设。 2、建设 TTFT、TPOT、吞吐、显存、稳定性等性能指标体系。 3、参与 profiler 数据分析、CI 自动化测试和版本质量门禁建设。 4、跟踪线上/测试问题,维护缺陷分级、根因归档和问题知识库。 5、协助形成模型适配、性能测试和发布准入标准。
一、AI工程师 1、参与企业级 AI Agent 平台基础设施的建设、部署和日常运维,保障平台稳定、安全运行; 2、负责 Red Hat OpenShift/Kubernetes 环境的基础运维,包括应用部署、扩缩容、配置管理、版本升级及故障处理; 3、通过应用日志、容器日志及监控指标,协助定位 AI 应用中的超时、排队、资源不足、网络异常和服务调用失败等问题; 4、参与 Kafka、Redis、PostgreSQL、MinIO、Milvus、Prometheus、Grafana、Loki 等 AI Infra 组件的安装、配置、测试和上线;…
岗位职责 1. 平台架构与选型: – 主导数据闭环平台总体架构设计,2026Q4前完成总体架构方案与关键技术选型(湖仓一体、流批一体、任务编排、训练/推理平台),并通过架构评审; – 制定平台3年技术演进路线,平衡自研与开源/商用组合,控制总体拥有成本。 2. 数据标准与数据模型: – 定义跨三域(智能制造、产品研发、研发工程)的统一数据模型与分层规范、数据标准与接口规范,推动多部门数据源对接时标准落地; – 建立架构评审机制,对各域数据接入与链路建设方案做技术把关。 3. 性能、可靠性与成本: – 负责算力/存储资源规划与成本优化,支撑训练与推理规模化后的性能与稳定性目标。…
岗位职责: 1. 参与设计多活容灾架构,负责云原生技术领域的架构演进,构建端到端的智能自愈体系,提升业务稳定性为核心目标。 2. 完善系统监控、日志和追踪体系,确保对系统健康度有全方位的洞察,持续降低MTTR。 3. 识别系统瓶颈,主导性能调优,降低延迟,提升资源效率控制成本。 4. 完善On-Call机制,负责处理告警和紧急故障,主导或参与事后复盘,撰写高质量的事故报告及完善故障预案,并跟进改进措施的落实。 5. 通过IaC实现资源治理,统一管理多云/混合云资源。 6. 完善SLO/SLI,用量化指标和目标来客观衡量和管理服务水平。…
· 主导深信服商业化 ToB AICP 算力平台、算力网关整体产品规划,覆盖异构算力统一纳管、MaaS 大模型推理、KV Cache 语义缓存、分布式中间件等底层基础设施,面向金融、医疗、政务、媒体等政企客户落地生产级 AI 业务。 · 联动售前、交付、销售团队深入一线,挖掘客户真实痛点:大模型部署门槛高、推理时延高、硬件成本贵、模型泄露风险等,完成需求调研、竞品对标,输出中长期产品 Roadmap。 · 协同算力调度、云原生、PaaS 中间件、AI 推理研发团队,拆解 vGPU 多实例、异构算力联合调度、模型全链路加密、一键训推部署等核心能力方案,输出 PRD、业务流程,统筹版本迭代落地。…
Kubernetes Linux Python 安全与运维 芯片 / 半导体
岗位职责: 1.端到端负责GPU研发环境的运维管理,包括环境规划、部署、运维、优化 2.组织运维过程中的故障根因分析,形成闭环策略,并推动落地 3.主导K8s集群及业务系统运维架构和体系优化,推动云原生、微服务升级 4.完善全链路监控体系,建立智能告警,主导重大故障应急与复盘,落地故障管理SOP。 5.跟踪Aiops/agent、云原生领域前沿技术,结合公司业务场景进行技术选型与落地实践,持续完善K8s集群平台功能,推动团队运维智能化 6.跨部门协作,对接研发、测试团队,优化流程提升交付效率 职位要求: 1.8年+DevOps/运维开发经验,3年+公有云及K8s运维经验,有大规模服务器(含G…
Docker Kubernetes 渗透测试 安全与运维 通信 / 计算机 / IT
岗位职责: 1. 设计开发自动化渗透测试框架与工具链,支持漏洞挖掘和利用的自动化处理,实现渗透测试流程的标准化与智能化,持续优化自动化测试的覆盖率与准确率。 2. 跟踪云安全领域最新威胁情报与攻防技术,挖掘云原生环境下的新型攻击向量与漏洞模式,开发针对容器、Kubernetes、Serverless等云技术的自动化检测工具。 3. 基于大语言模型构建渗透测试智能体(AI Agent),实现智能体的任务规划、工具调用与自主决策能力,开发智能体与传统渗透工具的集成接口,持续优化智能体的推理能力与攻击成功率。 4. 跟踪分析最新CVE漏洞,开展0day漏洞挖掘与深度安全研究,支持实战攻防团队的漏洞…
岗位职责: 1.产品规划与设计 - 负责智能化运维产品(如监控可观测、日志分析、自动化运维、故障预测等)的全生命周期管理,制定产品路线图; - 深入理解运维场景(如IT运维、云原生、DevOps),挖掘用户痛点,设计AI驱动的运维解决方案(如异常检测、根因分析、自愈能力); - 输出PRD、原型设计,协调研发、算法团队落地产品功能。 2.技术方案落地 - 协同算法团队,将机器学习/大数据技术转化为可落地的运维产品功能; - 主导与运维、开发团队的沟通,确保产品与现有工具链(如可观测、K8s)无缝集成。 3.数据驱动优化 - 基于运维数据(指标、日志、告警)分析用户行为,迭代产品功能,提升运维…
MySQL PostgreSQL Python 职能与支持 新能源 / 储能
核心职责 1. 标准制定与架构设计 制定公司级数据库选型标准、设计规范、安全基线,主导MySQL、PostgreSQL、Oracle等技术栈的标准化落地 设计跨数据中心的高可用、容灾架构(如MySQL MGR、PG流复制、Oracle Data Guard),制定RTO/RPO目标及演练机制 规划数据库技术演进路线,评估云原生、分布式数据库等新技术引入 2. 平台建设与自动化 主导数据库自动化运维平台建设,涵盖部署、监控、备份、变更等全生命周期管理 开发或引入工具链(如监控告警平台、SQL审核工具、慢查询分析系统) 推动Infrastructure as Code,实现配置模板化、部署容器化…
岗位一:服务治理高级/架构工程师 岗位职责 1.负责公司微服务治理体系的架构设计与核心能力建设,包括服务注册发现、RPC 框架、API 网关、负载均衡等核心组件的规划与演进,支撑业务规模化发展。 2.负责流量治理能力建设:超时、重试、熔断、限流、隔离、降级等稳定性能力的标准化与平台化,以及灰度发布、全链路压测、流量调度等场景落地。 3.负责服务治理体系与 Kubernetes 原生机制的融合设计(Service、EndpointSlice、Readiness、优雅上下线等),统一容器与虚拟机场景的治理体验。…
1、负责对公司系统、网络及应用进行安全漏洞挖掘与渗透测试,输出详细报告。 2、参与红蓝对抗演练,模拟真实攻击场景,评估安全防御体系有效性。 3、跟踪最新安全漏洞与攻防技术,协助团队完善安全检测规则与防护策略。 4、配合开发团队完成安全修复验证,推动漏洞闭环管理。 5、编写安全测试文档与操作指南,沉淀测试案例与方法论。
需求分析 大模型 渗透测试 安全与运维 通信 / 计算机 / IT
【岗位职责】 1. 建设产品安全架构体系,对齐业界最佳安全实践(纵深防御、零信任、最小攻击面等) 2. 推进AI Agent安全架构规划与完善,构建产品AI 安全基座,支撑各类AI产品安全稳定运行 3. 深入理解业务安全场景,结合业务目标与风险输出最佳的安全实践方案,推动方案落地并持续迭代 4. 以 AI 辅助开发(Vibe Coding)为核心生产力,参与安全治理平台与防御能力研发建设 5. 参与安全运营工作,包括安全事件分析与处置、漏洞挖掘与应急响应,制定防御策略和治理方案,协同业务团队共建完善的安全防护体系 【岗位要求】 1. 本科及以上学历,计算机或信息安全相关专业优先,具备 5~1…
1. 系统架构设计与技术规划 - 负责自动驾驶数据闭环平台的整体架构设计,涵盖数据采集、传输、存储、预处理、标注、模型训练、仿真评测等核心模块的技术选型与方案制定 - 设计高可用、高扩展性的分布式系统架构,支持PB级海量数据处理及千亿级样本的高效管理与检索 - 制定平台技术演进路线,结合行业趋势(端到端模型、BEV感知、Occupancy网络等)优化架构设计,确保技术前沿性 - 面向未来机器人业务,规划跨域数据闭环技术路线,支撑多模态感知与决策系统的数据需求 2. 数据飞轮与自动化流水线建设 - 搭建云端数据飞轮基础设施,构建从数据采集、清洗、挖掘、标注到模型训练、部署的完整自动化闭环 - …
Python Java SQL 后端与架构 新能源 / 储能
岗位职责 1、负责 Agent 系统与算法平台的工程实现与完善; 2、辅助构建与维护数据与模型工程基础设施; 3、负责后端服务与必要的前端界面开发; 4、与算法工程师、业务专家紧密协作,推动系统测试、上线与迭代; 5、参与工程架构设计,提升系统的可扩展性与可维护性。 任职要求 1、本科及以上学历,计算机相关专业,3 年左右及以上工程经验; 2、熟练掌握 Python / Java / Go / Node.js 中至少一门后端语言; 3、熟悉常见 Web 与服务端技术:RESTful API、数据库(SQL / NoSQL)、缓存、消息队列; 4、有良好的工程意识,关注代码质量、性能与稳定性;…
1.负责湖北省政务云、行业云市场的拓展。 2.具备牵头战略项目的能力,做好项目客户交流、需求引导、方案设计等工作; 3.负责重点行业解决方案架构的沉淀,并面向销售和伙伴的赋能,帮助销售提升作战能力; 4.在项目运作和解决方案构建中协调合作伙伴,负责对合作伙伴赋能,使其具备面向行业云计算、大数据等解决方案的初步规划能力。 岗位要求: 1.5年以上IT行业从业经历,熟悉云计算+行业解决方案的设计过程和设计方法,并具备一定的解决方案架构设计经验; 2.具备与政府和企业高层汇报交流的能力,并有大项目操作案例; 3. 熟悉云计算、大数据、人工智能、云原生等相关领域技术并具备丰富的实践经验;…
Python Java 高并发 测试与质量 通信 / 计算机 / IT
工作职责: 1、质量体系建设:参与制定和完善部门测试流程、规范与质量标准,搭建可持续迭代的自动化测试体系,优化测试流程,提升整体测试交付效率与质量。 2、自动化测试研发:负责基于k8s的AI产品的自动化测试框架搭建、脚本开发、维护与迭代,覆盖接口测试、端到端、性能、稳定性测试等场景,保障版本迭代高效回归。 3、测试工具与平台开发:根据业务测试痛点,独立研发、优化测试辅助工具、测试调度平台、缺陷管理工具、性能监控工具等,解决手工测试低效、重复劳作等问题,赋能测试团队。 4、性能与专项测试:负责产品性能测试、压力测试、稳定性测试、兼容性测试等专项测试工作,制定测试方案、执行测试、输出测试报告,定…
团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。…
Linux Python Java 算法与AI 通信 / 计算机 / IT
1、负责人工智能平台及核心中间件的研发,推动AI服务、容器服务、MaaS服务建设,以及模型的工程化落地; 2、参与社区内容建设,主导AI相关资源库(模型库、数据集、智能体应用等)的架构设计; 3、前沿技术落地:持续跟进AI领域最新动态,将最新LLM技术转化为产品功能,持续优化产品性能与客户体验;
Python Linux CI/CD 安全与运维 机器人 / 智能装备
1. 开发迭代效能中台、CI/CD流水线、制品管理等基础设施,支撑业务研发交付 2. 构建编译→构建→部署→扫描→环境治理全链路自动化能力,降低人工成本、缩短交付周期 3. 建立研发效率与质量指标体系,通过数据复盘驱动流程持续改进 4. 识别交付卡点与流程冗余,以工具改造+流程标准化落地提质提效方案 5. 跟进 DevOps 云原生/智能研发趋势,落地创新效能工具与优化方案 6. 沉淀研发效能规范与文档,为业务团队提供工具支持与使用指导
团队介绍:字节跳动基础设施计算团队,专注构建面向大模型与 AI Agent 时代的 AI-Native Infra。我们从算力、系统到平台,围绕“AI 如何高效运行、持续进化、规模化落地”这一核心问题,重构计算基础设施。我们管理着数十万台服务器组成的超大规模集群,构建统一的异构算力调度与云原生运行体系;通过软硬协同与自研框架,持续突破大模型训练与推理的性能瓶颈;并进一步向上,打造企业级 AI Agent Infra,让 Agent 具备身份、权限、记忆、观测与治理能力,真正成为可运行在生产环境中的新型“应用形态”。…
Kubernetes Docker 微服务 安全与运维 央企
1、制定并执行公司云计算业务的技术发展战略,主导云原生、分布式云、AI算力云等核心产品的架构设计与演进; 2、全面负责科技研发部的管理,包括研发流程体系建设、代码质量管控、技术难题攻关及团队梯队建设; 3、主导重大技术决策,解决高并发、高可用性、数据一致性等核心系统难题,确保云平台的稳定性与安全性; 4、负责跨部门(产品、运维、生态)的技术协同,推动技术成果转化与商业化落地。 5、关注前沿技术(如Serverless、AIGC Infra),带领团队进行技术创新与专利布局。
职位描述 参与 GLM 机器学习平台开发,构建面向大模型训练、评测与强化学习(RL)的下一代 Agent 基础设施。 随着大模型能力从静态文本生成走向工具调用、环境交互、多步推理和自主任务执行,Agent Infra 已经成为模型研发中的关键环节。尤其在 RL 场景中,稳定、高效、可扩展的 Agent Infra 能够显著提升数据采集、环境交互、奖励评估、任务编排与训练反馈的效率,是推动模型能力持续迭代的重要基础。 在这里,你将参与搭建服务于前沿大模型研发的基础设施,与算法、训练、数据和平台团队紧密合作,支撑大规模 Agent 训练、评测和迭代流程。…
1. 负责车联网核心系统云平台、PaaS、基础架构的系统稳定性建设; 2. 与开发测试、业务团队密切合作,快速响应和解决生产问题,确保系统正常运行; 3. 参与AI运维平台及自动化开发建设,优化运维规范、工作流程、应急预案等; 4. 参与技术方案评审,能够从运维角度主动识别风险并给出解决方案,推动架构优化;
Linux Go Python 安全与运维 通信 / 计算机 / IT
职位描述: 1. 负责公有云业务SRE平台设计与开发 2. 负责公有云业务的稳定性、质量及效率提升 3. 负责业务应用服务容器化、持续集成等系统设计开发工作; 4. 对现有系统提出建议,并组织改进实施; 职位要求: 1. 计算机相关专业毕业,本科及以上学历,1年以上互联网行业研发经验;有云计算研发经验优先考虑 2. 熟悉运维自动化、服务化和运营理念,熟悉Linux基本原理、网络和互联网运维技术; 3. 熟练掌握Golang/Python编程语言,熟悉主流开发框架如Beego/Gin等,并具备3个以上项目开发经验;…
Python Kubernetes 大模型 算法与AI 互联网
-参与设计与研发面向大模型推理服务的推理部署平台与推理引擎基础设施,构建高吞吐、低延迟、高可用的推理系统,支撑大规模Token推理请求处理 -参与大模型平台后端推理服务、推理部署平台研发 -参与平台内组件、工具的开发 - 参与定制需求的开发工作 -参与大模型推理技术调研等工作
Python C++ 大模型 算法与AI 通信 / 计算机 / IT
大模型后端开发 岗位职责: 1、设计和实现大模型智能体以及工作流相关的框架、工具链,并推动落地到实际业务场景中; 2、优化大模型推理以及可观测性相关基础设施,持续提升平台算力运营能力; 3、探索业界前沿的机器学习相关技术,持续提升平台能力、降低算法使用成本; 岗位要求: 1. 本科及以上学历,计算机科学、软件工程、人工智能等相关专业; 2. 具备较强的编程能力,熟悉Go、Python、C++语言之一; 3. 熟悉计算机体系结构、数据结构和算法、操作系统、网络等基础原理; 4. 有积极的学习意识、较强的动手能力和钻研精神,具备良好的沟通和团队协作能力;…
- 参与dumate agent的设计与研发 - 参与agent基础设施相关工作,包括技术调研、需求沟通、代码开发等 - 负责dumate平台基础管控系统的维护和升级,进行性能优化、稳定性建设,提升资源利用率 - 参与agent相关前沿技术调研和创新能力落地
1.平台核心功能设计与迭代:负责 MaaS 推理服务平台的产品规划与全生命周期管理,涵盖模型接入、高并发在线推理、API 网关治理、批处理推理、自动化部署运维及计费计量等核心模块。 2.性能、成本与体验打磨:深度理解大模型推理关键性能指标(TTFT、TPS、吞吐量、并发度、长上下文延时等),配合底层系统与算法团队,围绕推理加速、显存/算力利用率提升与成本优化,设计面向开发者与企业的高可用、低延时服务体系。 3.开发者体验与开放生态建设:负责模型 API 标准化接口设计(如兼容主流规范)、SDK 及开发者控制台(Web UI)的产品规划;…
为什么我们需要你 我们需要一位 Senior SRE 来完成关键的战略转向:将可靠性工作从“事后救火”推进到“事前设计”。你的核心使命是建立三道防线——可预测的发布工程、信号清晰的观测体系、持续进化的应急响应机制。这是一份高自由度、高可见度的角色。你将直接向工程负责人汇报,拥有跨团队推动技术决策的权限。成功意味着你建立的 SRE 实践将成为公司下一阶段增长的 engineering backbone。 你将负责什么 1. 构建可持续的 On-call 与应急响应体系 · 重构现有报警体系,建立分级降噪机制(解决 P0 淹没问题),实现故障的分钟级发现与精准定位。…
工作职责: - 负责业务全链路运维保障,涵盖系统、网络、容器、中间件、数据库领域,承担线上故障应急处置、预案建设与演练,完成故障复盘,迭代 SOP 与应急预案,形成问题经验闭环。 - 牵头处理跨域复杂线上故障,拆解排查路径、定位根因并推动问题闭环,运用大模型开展日志分析、故障诊断、脚本生成,提升问题处置效率。 - 搭建 SLI/SLO 稳定性量化体系,落地容量规划、容灾备份、流量调度,识别潜在运维风险并完成前置治理,利用 AI 能力实现流量预测、风险预判。 - 设计并落地指标、日志、链路、流量全链路可观测体系,建设分级告警与告警降噪机制,借助 AI 完成异常关联分析,缩短故障 MTTR。…
Java Python C++ 算法与AI AI / 大模型
1. 面向咔皮记账线上 Agent 业务,负责服务端核心架构设计与演进,构建现代化 AI Agent 产品体验和架构,支撑高速变化的应用形态和业务需求。 2. 作为业务 Owner,主动理解 Agent 产品目标,拆解技术路径,拉通产品、设计、客户端、算法、数据、测试协作,并对项目结果负责。 3. 端到端推进需求落地,覆盖需求澄清、方案设计、开发实现、跨端联调、上线灰度、监控报警、问题修复和复盘改进。 4. 主导线上 Agent 后台核心能力建设,包括任务编排、工具调用、上下文管理、记忆系统、模型路由、权限控制、执行追踪和效果评估。…
岗位概述 负责公司自动驾驶端到端大模型训练平台的核心调度系统设计与开发。面向千卡/万卡级 GPU 集群,打造高吞吐、高资源利用率、网络拓扑感知的训练任务调度引擎,支撑大规模分布式训练(PyTorch/NCCL)的高效稳定运行。 核心职责 1、调度系统架构与开发 · 设计并实现面向 AI 训练场景的集群调度器,支持 Kubernetes / Slurm / 自研调度框架的二次开发与深度优化 · 实现 Gang Scheduling、Capacity Scheduling、抢占与弹性扩缩容等核心调度策略 · 开发任务排队、优先级管理、资源配额与多租户隔离机制 2、GPU 与网络拓扑感知调度 · …
工作职责: 1. 负责公司应用软件后端基础架构与公共中间件能力建设,涵盖服务框架、配置中心、注册发现、网关、消息、缓存、搜索、任务调度等; 2. 面向多BU建设统一服务治理体系,推动接口规范、发布规范、可观测性、安全基线和容量治理; 3. 负责支撑公司各 BU 应用软件后端的多租户、权限、审计、稳定性与弹性设计; 4. 推动基础能力平台化、自助化和可复用,降低BU自建成本与重复建设; 5. 与客户端/前端、安全、效能/稳定性团队协同,打通从开发到发布到运行的链路; 6. 负责后端基础架构团队建设、技术规划和关键项目攻坚。…
Python 大模型 向量检索 后端与架构 AI / 大模型
我们正在寻找对 LLM(大语言模型) 和 Agentic Workflow(智能体工作流) 充满热情的开发者。你将负责构建具有高度自主性、能够解决复杂任务的AI智能体,探索从 "Chatbot" 到 "Actionbot" 的边界,让AI真正成为业务流程中的“执行者”。 岗位职责 1. 智能体架构设计与开发 • 基于主流大模型(Qwen, DeepSeek, Sense Nova-SI 等),设计并实现高可用的AI Agent架构。 • 负责Agent核心模块的研发,包括:任务拆解与规划(Planning)、工具/API调用(Function Calling)、长期记忆机制(Memory/R…
1.参与 AI 算力云原生平台整体架构设计与核心模块研发,负责训练调度、资源管理、任务运行时等关键子系统的设计与实现,支撑万卡级 GPU/NPU 集群稳定运行与资源利用效率持续优化; 2.深度参与 Kubernetes 调度器及资源管理体系的定制化开发,建设面向 AI 训练与推理场景的优先级调度、资源抢占、Gang 调度、拓扑感知、弹性伸缩等能力,满足大规模分布式训练及在线推理需求; 3.参与 Agent 沙盒平台架构设计与核心能力建设,面向 AI Agent、代码执行及科研计算等场景,建设高并发、强隔离、弹性化的 Sandbox Runtime,负责沙盒生命周期管理、资源调度、镜像与环境管…
团队介绍:我们团队为字节跳动旗下各类业务线提供信息安全保障。通过与各业务团队紧密协作,我们针对其特定的运营及业务需求,设计并落地专属安全策略。依托安全部门的专业能力,我们交付与业务目标高度契合、兼具成本效益与可扩展性的安全解决方案,助力各团队获取最高效、最可靠的安全服务与工具。 1、AI产品安全体系建设:负责豆包等AI产品的全生命周期安全,基于敏捷需求迭代节奏落地AI Product Security Program,覆盖需求评审、架构评估、代码审计、渗透测试、上线验收等环节,将安全能力嵌入研发流程; 2、AI新型风险攻防:跟踪并实战LLM/Agent领域的新型攻击面,包括但不限于Promp…