说不清条件?直接问一句 →(例:合肥的BMS要几年经验)
要求 Flink 共 553 条 · 其中近一周 17 条 已筛选: 清除
大模型 Hadoop Spark 安全与运维 通信 / 计算机 / IT
【岗位职责】 1. 持续洞察国内外AI与威胁情报前沿技术,制定未来3-5年AI-Native情报能力中台的技术发展路线图,探索情报生产、分析与分发的新范式。 2. 引入大模型、图关联等前沿AI算法,深度结合安全底层机理,大幅提升威胁检测的准确率,将误报率降至行业极低水平。 3. 基于海量数据深度挖掘高级威胁模式与关联关系,构建AI-情报生产数据飞轮,驱动AI模型的训练与迭代,以此孵化具有独特价值的新型情报检测引擎。 4. 建立行业领先的情报评测指标体系,构建端到端的技术反馈闭环,精准追溯能力短板,驱动内部技术架构进行系统性改进。…
IT系统是企业的助推器,IT系统开发技术也是具有竞争力的行业技术之一,通过提供一系列跟业务相结合并支持业务发展的IT系统产品,帮助vivo各业务线搭建起高系统性能、业务连续性强、安全又合规的IT基础设施,是每个vivo IT人的不懈追求! 在这里, 你将有机会与业界技术牛人一起玩转PB级数据传输、存储、计算、分析; 你将有机会与技术达人一起构建企业级数据仓库; 你将与我们一起建设数据应用产品与数据分析体系; 你将是vivo数据中台建设的一分子。 你将与我们一起专注于如下工作: 1、参与相关技术方案的设计与评审,制定与业务方案相匹配的技术方案,并确保方案有效落地;…
立讯精密 昆明 上海 苏州 常熟 昆山 华东园区 应届 本科
一、IT程序设计工程师 1.负责生产相关系统的迭代开发及持续优化 2.负责数字化相关应用系统的规划与开发 3.负责新项目需求分析/规划设计/开发导入 4.负责开发相关新技术研究及落地导入 二、IT网络工程师 1.负责网络设备的配置、安装和维护工作 2.参与网络故障排除和问题诊断,协助解决网络故障和连接问题 3.支持网络安全团队,参与基础安全措施的实施和监控 4.网络设备的更新和升级,确保网络设备的稳定性和安全性等事项 三、大数据开发工程师 1.负责数据底的ETL和业务需求开发,掌握工厂运营相关的业务流程和数据模型 2.掌握大数据开发,离线和实时开发流程,掌握开发技能 ,能需求场景开发用户的需…
SQL MySQL PostgreSQL 通信 / 计算机 / IT
岗位职责: 1. 设计、开发和维护高效、可扩展的数据管道(Data Pipeline)。 2. 负责数据仓库(Data Warehouse)的主题数据构建、优化和管理。 3. 编写ETL(Extract, Transform, Load)脚本,确保数据从多个来源高效集成。 4. 与数据分析师和业务团队合作,理解数据需求并提供技术支持。 5. 优化数据存储和查询性能,确保数据平台的高可用性和稳定性。 6. 监控数据流程,及时发现并解决数据质量问题。 7. 开发和维护数据接口和API,支持内部和外部数据访问 8. 撰写和维护相关技术文档 任职要求: 1. 教育背景: 计算机科学、信息技术、数学、…
1.全面负责数据开发平台、可视化平台的全生命周期建设与管理,牵头完成两大平台的架构落地、部署配置、联调测试及验收闭环工作。 2.负责中标云厂商(阿里云 / 华为云 / 腾讯云) 数据开发平台选型落地(阿里云 DataWorks/Dataphin、华为云 DataArts Studio、腾讯云 DataArts Studio),主导数据集成、智能建模、任务调度等核心功能的部署与优化,联动数据底座实现数据全链路开发。 3.负责可视化平台选型落地(QuickBI、永洪、帆软),主导可视化拖拽、多维度分析、报表生成等功能的部署与调试,实现数据可视化呈现与高效分析。…
职责描述: 1. 构建面向模型训练所使用多远数据集的存储系统; 2. 基于模型训练需求完成数据采集、数据存储、数据处理、提供服务功能; 3. 基于数据湖和数据仓库整合完成湖仓一体化存储架构。; 4. 基于数据的一致性、时效性、准确性和数据标记等不断提高数据质量; 经验要求:5年以上大数据开发经验; 技能要求: (1)精通Sqoop/Canal、Flume、Kafka等一种以上数据采集工具; (2)熟练并精通使用HDFS、HBase、Kudu、Hudi等一种以上存储系统和性能优化; (3)精通MapReduce、Spark、Impala/Presto、Storm、Flink等一种以上数据处理技…
岗位职责(具体工作内容) 1.负责国际化外卖搜广推数据流转体系建设,基于 MQ、Flink、Spark、Redis、Go 等技术,打通曝光、点击、转化、商家、商品、用户行为、特征、样本、标签等核心数据链路,支撑召回、排序、广告与策略优化闭环。 2.负责国际化外卖实时数据研发,构建面向搜索、推荐、广告、运营等场景的实时数据处理与分发能力,涵盖消息接入、流式 ETL、维表关联、实时特征计算、缓存服务、数据回流及监控治理,提升数据时效性、稳定性与可用性。 3.负责国际化外卖底层数据开发,搭建离线实时一体化数据链路、特征仓库、指标体系、样本体系与数据资产平台,提高数据质量、计算效率与复用能力。…
Java Spring Scala 数据 通信 / 计算机 / IT
-负责大数据平台的部署和规划建设; 转换业务需求,参与数据仓库(离线、实时)和数据应用的建设、开发和维护(需出差)。
Hadoop Spark Flink 产品 通信 / 计算机 / IT
岗位职责 1. 数据平台规划与设计: ○ 负责数据平台产品的全生命周期管理,包括需求分析、功能设计、落地交付及迭代优化,聚焦数据源管理、数据处理、数据标注等核心能力,与训推平台深度配合,构建高效的数据流转闭环。 ○ 设计支持多场景的数据管理模块,覆盖数据接入、清洗、存储、标注、版本控制等全流程功能。 2. 技术架构理解与落地: ○ 深入理解数据平台技术架构(如大数据组件、分布式计算、数据存储方案等),与架构师、算法及工程团队协作,输出可落地的产品方案。 ○ 推动数据标注工具、自动化数据处理流程(ETL/数据清洗)等功能的开发与优化。…
岗位职责 1. 平台架构与选型: – 主导数据闭环平台总体架构设计,2026Q4前完成总体架构方案与关键技术选型(湖仓一体、流批一体、任务编排、训练/推理平台),并通过架构评审; – 制定平台3年技术演进路线,平衡自研与开源/商用组合,控制总体拥有成本。 2. 数据标准与数据模型: – 定义跨三域(智能制造、产品研发、研发工程)的统一数据模型与分层规范、数据标准与接口规范,推动多部门数据源对接时标准落地; – 建立架构评审机制,对各域数据接入与链路建设方案做技术把关。 3. 性能、可靠性与成本: – 负责算力/存储资源规划与成本优化,支撑训练与推理规模化后的性能与稳定性目标。…
岗位职责 1. Pipeline平台构建: – 构建统一数据Pipeline平台底座:任务编排与调度、批流一体加工引擎、链路依赖管理、失败重跑与断点续传,支撑三域(制造/产品/工程)数据加工与座舱采集数据后处理的规模化运行; – 建设样本/特征生产链路,为训练平台提供标准化数据供给。 2. 开发范式与组件沉淀: – 定义Pipeline开发模板、配置规范与可复用组件库,让领域链路开发(第1名Pipeline工程师及后续领域成员)以低代码/配置化方式上线新链路; – 将数据质量规则(完整性、一致性、时效性校验)内嵌到链路框架,实现质量问题自动拦截与告警。…
1、调度&存储方向:负责自动驾驶数据闭环基建,实现 CPU/GPU 异构算力调度与弹性伸缩,统一 Dataset/Bag/Frame 元数据建模与存储; 2、平台方向:负责自动驾驶数据闭环平台层建设,支持数据挖掘、数据清洗、数据生产等多项业务。
职责描述: 1. 构建面向模型训练所使用多远数据集的存储系统; 2. 基于模型训练需求完成数据采集、数据存储、数据处理、提供服务功能; 3. 基于数据湖和数据仓库整合完成湖仓一体化存储架构。; 4. 基于数据的一致性、时效性、准确性和数据标记等不断提高数据质量; 经验要求:5年以上大数据开发经验; 技能要求: (1)精通Sqoop/Canal、Flume、Kafka等一种以上数据采集工具; (2)熟练并精通使用HDFS、HBase、Kudu、Hudi等一种以上存储系统和性能优化; (3)精通MapReduce、Spark、Impala/Presto、Storm、Flink等一种以上数据处理技…
岗位职责(具体工作内容) 1.参与滴滴国际化数据体系建设 2.参与数据采集、ETL、建模、开发、分析等标准化搭建 3.参与数据体系化流程化治理 4.参与业务问题拆解、转化、沟通与解决赋能 任职资格(学历、目标院校、语言、技能、性格等要求) 1.了解大数据生态/数据开发/分析/产品优先,包括但不限于Hadoop、Spark、Flink、StarRocks 2.熟悉Java/Python/shell任意一门编程语言,熟练使用SQL、Excel等常用办公工具 3.具备快速学习能力、逻辑思维能力和团队精神,有较强的责任心和学习积极性 4.每周实习>=4天,实习周期>=6个月,北京高校、可快速到岗、有…
Linux 分布式 Java 数据 通信 / 计算机 / IT
工作职责 1. 参与大数据产品后台架构设计与研发。 2. 配合业务需求完成产品迭代、功能开发与维护。 3. 参与线上问题排查与分析,协助解决用户使用过程中的技术问题。
1. 系统架构设计与技术规划 - 负责自动驾驶数据闭环平台的整体架构设计,涵盖数据采集、传输、存储、预处理、标注、模型训练、仿真评测等核心模块的技术选型与方案制定 - 设计高可用、高扩展性的分布式系统架构,支持PB级海量数据处理及千亿级样本的高效管理与检索 - 制定平台技术演进路线,结合行业趋势(端到端模型、BEV感知、Occupancy网络等)优化架构设计,确保技术前沿性 - 面向未来机器人业务,规划跨域数据闭环技术路线,支撑多模态感知与决策系统的数据需求 2. 数据飞轮与自动化流水线建设 - 搭建云端数据飞轮基础设施,构建从数据采集、清洗、挖掘、标注到模型训练、部署的完整自动化闭环 - …
1、调度&存储方向:负责自动驾驶数据闭环基建,实现 CPU/GPU 异构算力调度与弹性伸缩,统一 Dataset/Bag/Frame 元数据建模与存储; 2、平台方向:负责自动驾驶数据闭环平台层建设,支持数据挖掘、数据清洗、数据生产等多项业务。
1、负责视频生成数据平台建设,设计数据处理算子及 DAG 编排执行能力; 2、建设大规模数据 Pipeline 的分布式执行能力,包括任务调度、资源管理、失败恢复和断点续跑; 3、面向视频、多模态及 GPU 计算场景,优化 CPU、GPU、存储和网络之间的数据流转,提升处理吞吐和资源利用率; 4、建设平台可观测和任务管理能力,支撑大规模数据任务稳定运行和快速问题定位; 5、与算法团队深度协作,支持数据处理能力快速接入和迭代,提升训练数据生产效率。
Java Scala Flink 研发(未细分) 通信 / 计算机 / IT
负责分布式实时计算引擎的设计与开发工作 职位要求: 1、熟悉Java或者Scala语言,数据结构和算法基础扎实 2、熟悉常用的分析以及故障诊断工具 3、对Flink有深入理解,有社区开源贡献优先 4、了解Kafka或者其他分布式消息队列优先 5、了解SQL语言,了解存储过程和函数优先 6、良好的团队合作能力
为什么加入我们 1. 你会直接参与大模型训练前最核心的数据生产链路,数据质量、吞吐和覆盖度会影响模型能力上限。 2. 这里不是传统离线数仓,而是面向预训练数据构建的大规模分布式数据基础设施。 3. 你会在真实海量数据场景中使用 Spark 等分布式计算技术,解决解析、清洗、过滤、去重、质量评估和采样的工程问题。
Java Scala Python 数据 通信 / 计算机 / IT
1.负责大数据需求开发工作,完成项目模块的交付。 2.负责对客户/公司内部等大数据需求方提供技术支持。 3.参与大数据平台的建设、运维以及性能调优
1. 数据采集与集成,设计并实现数据采集方案; 2. 数据存储与管理,设计和优化数据存储架构,选择合适的数据库或数据仓库; 3. 数据处理与构建,开发和维护数据处理管道,支持批量处理或实时流处理;优化数据处理效率,解决数据延迟、冗余等问题,提升数据流转性能; 4. 数据质量与安全,建立数据质量监控机制,识别并修复数。
职位简介: 关键字:多模态湖仓、数据资产、数据治理与服务 如果说大模型是AI时代的“大脑”,那么数据就是它的“神经元”与“血液”。我们相信,模型效果的边界,由数据基建的上限决定。在这个岗位上,你不是简单的“查数工具人”,而是负责构建支撑千亿参数模型训练的自研数据基座。你将直面EB级数据的实时流转、清洗与配比难题,用极致的系统性能,缩短模型迭代的数据准备时间从“周”到“小时”。 工作职责: 1. 湖仓:设计AI场景的湖仓一体架构(Iceberg / Delta Lake / Hudi)处理 PB 级数据,主导多模态湖仓整体架构(结构化 + 非结构化 + 向量数据统一存储与访问);…
资深JAVA工程师(平台治理处置-南京) 岗位职责: 1.具有平台治理 - 处罚中心 相关业务经验; 2. 具备系统线上问题的排查、定位、解决,持续优化性能和效率; 3.对现有系统进行改进和优化; 4.设计与梳理系统/接口规范文档。 岗位要求: 1、本科及以上学历,计算机相关专业优先。 2、5年及以上Java开发经验,熟悉Spring等开源框架,并可以使用Java相关技术和工具解决常见商家治理问题。 3、熟练掌握MySQL、Redis 等数据库。 4、备独立分析和解决问题的能力,善于沟通和协作,具有良好的团队合作精神。有较强的自我驱动力,对专业技术发展具有强烈的探索欲望和创新精神。…
Python Java Kubernetes 数据 通信 / 计算机 / IT
岗位职责 1. 参与自动驾驶数据平台的数据治理工作,针对增量、全量数据实现降本功效 2. 推进平台数据地图、质量规则、血缘追溯、数据标注的治理体系化、流程化落地 3. 支持平台工作流相关算法适配、功能版本迭代,有力服务好业务团队的需求 4. 参与新数据湖仓挖掘体系建设,参与地图轨迹绑道、图搜、VLM等挖掘能力建设
大模型 RAG Hadoop 安全与运维 通信 / 计算机 / IT
【岗位职责】 1. 持续洞察国内外AI与威胁情报前沿技术,制定未来3-5年AI-Native情报能力中台的技术发展路线图,探索情报生产、分析与分发的新范式。 2. 引入大模型、图关联等前沿AI算法,深度结合安全底层机理,大幅提升威胁检测的准确率,将误报率降至行业极低水平。 3. 基于海量数据深度挖掘高级威胁模式与关联关系,构建AI-情报生产数据飞轮,驱动AI模型的训练与迭代,以此孵化具有独特价值的新型情报检测引擎。 4. 建立行业领先的情报评测指标体系,构建端到端的技术反馈闭环,精准追溯能力短板,驱动内部技术架构进行系统性改进。…
Spark Hadoop Flink 后端与架构 芯片 / 半导体
岗位职责: 1. 深入掌握 Spark、 Hadoop、 Trino、 StarRocks、Flink 等大数据引擎。负责性能调优,精准定位性能瓶颈、故障卡点问题。 2. 熟练使用 TPCDS、 HiBench 等常用大数据Benchmark 工具,进行性能测试和多维度性能评估和优化(包括吞吐量、延迟、资源使用等等)。 3. 根据业务需求制定并实施基于Hygon 硬件平台的大数据引擎性能优化方案,包括内存、计算调度、向量化计算、IO 等方面的优化。 4. 跟踪大数据领域前沿技术与行业发展趋势,输出落地性技术方案支持公司发展。 5. 与团队共享技术经验,提高团队整体技术能力和工作效率。…
岗位职责: · 负责数据平台的整体产品规划与设计,制定产品路线图,推动产品从需求到上线的全流程落地 · 承担数据平台核心模块的产品设计,包括元数据管理、数据资产管理、数据检索、数据版本管理、数据血缘、数据服务 API 等 · 推进数据治理相关能力的产品化建设,包括数据质量管控、数据标准统一、数据权限管理 · 协同数据研发、工程研发、业务团队,深入了解用户需求,挖掘数据消费场景,输出可落地的产品方案 · 负责数据运营相关工作,包括数据资产运营、用户运营和数据使用分析 · 跟踪数据平台领域技术发展趋势,进行竞品调研,持续优化平台产品能力 任职要求: · 本科及以上学历,3 年以上数据产品经理经验…
1.负责 WorkBuddy Agent 业务的数据体系建设,包括数据采集、清洗、建模、加工、存储及数据服务,持续完善业务数仓与指标体系; 2.深入理解智能体产品业务场景,围绕用户增长、活跃、留存、转化、Agent 使用行为、任务完成情况等核心方向开展数据分析,能够从数据中发现问题、定位原因并提出业务优化建议;负责核心业务指标、用户行为分析体系及专题分析建设,对数据变化具备较强敏感度,能够主动识别异常、趋势和潜在业务机会; 3.设计和优化数仓分层、主题域及数据模型,建设稳定、高效、易用的数据资产,提升数据开发效率及下游分析体验;…
特斯拉 上海 AI与数据分析 AI& Data Analytics
The Role We're looking for a Data Engineer to join our Data Engineering team and play a pivotal role in shaping how Tesla leverages data across its Sales, Delivery, and Service lifecycle. You'll design, build, and scale our Enterprise Data Warehouse and AI/BI-powered intelligent solutions — directl…
参与公司大数据平台、数据仓库、实时数据链路设计与开发,负责离线 / 实时数据采集、清洗、加工、调度落地; 基于 Flink、Spark、Hive、Doris、Iceberg 、 paimon 等大数据组件搭建数据处理任务,建设业务指标体系,支撑数据分析、报表、业务数字化决策; 对接业务、算法团队需求,完成数据需求评审、数据模型设计、ETL 开发、任务运维与问题排查; 持续优化数据任务性能、存储成本、任务稳定性,提升数据产出时效与资源人效; 参与数据规范、数据质量、数据血缘治理,推动团队数据资产标准化建设。
1. 负责公司业务数据的ETL工作,完成数据抽取、清洗、加工、转换与加载,保障数据质量与数据时效性 2. 负责数据报表开发、数据模型构建,支撑业务数据分析、数据可视化与业务决策需求 3. 负责数据相关的API开发与维护,对接业务系统与前端应用,保障数据接口的稳定与高效 4. 参与AI场景应用的落地工作,实现数据预处理、模型应用与相关功能开发 5. 负责大数据平台的日常维护与优化,跟进大数据领域新技术,推动数据技术在业务场景的落地应用 6. 配合业务部门完成数据需求调研、数据分析与技术支持,解决数据相关的技术问题 7. 负责数据相关文档的编写与维护,保障数据流程的可追溯性与可维护性 8. 参与…
大模型 多模态 RAG 算法与AI 通信 / 计算机 / IT
1.负责Data Agent设计开发,包括智能数据治理、智能数据分析等,主导Data Agent在实际业务场景中的技术落地与优化,实现Agent对数据和业务的深度准确分析理解; 2.工程化落地大模型智能应用形态,独立负责AI应用从0到1的端到端开发交付,前端交互页面、后端服务、AI 能力集成三层全栈闭环,研发交付真正可用、可上线的产品; 3.参与数据仓库、业务知识库、本体和知识图谱等构建,以及大模型和AI应用部署; 4.跟进大模型人工智能等前沿技术演进,主导技术选型评估; 负责完成上级交办的其他产品研发规划和研发预研工作。
职位描述 负责智能驾驶 AI 数据基础设施(Data Infrastructure)的整体规划、架构设计与持续演进,围绕端到端自动驾驶模型训练,建设覆盖数据采集、湖仓存储、治理、挖掘、标注、数据生产、数据交付及 Data Loop 的 AI 数据供应链,打造 PB~EB 级多模态数据基础设施,持续提升数据生产效率与模型迭代效率。 工作职责 1、负责 AI 数据基础设施架构建设 - 负责智能驾驶 AI 数据基础设施整体架构规划与演进; - 构建 PB~EB 级多模态数据基础设施,支撑视频、图片、点云、日志、标签等数据统一管理;…
Python Java Docker 运营 新能源 / 储能
1.参与公司AI中台整体架构规划与设计,根据公司数字化转型战略,搭建统一的机器学习平台,覆盖数据接入、特征工程、模型训练、模型评估、模型部署、在线推理、监控告警等全生命周期管理; 2.负责公司级MLOps体系建设,构建标准化的模型持续集成/持续部署(CI/CD for ML)流水线,实现模型版本管理、自动化测试、灰度发布和回滚机制,将模型从实验到上线的周期从"周级"缩短到"天级"; 3.负责搭建统一特征存储与服务层(特征平台),支持离线/在线特征的一致管理和高效复用,解决特征重复计算和数据孤岛问题; 4.负责建设高性能、高可用的模型推理服务网关,支持多框架模型(TensorFlow/PyTo…
分布式 Spark Flink 算法与AI 机器人 / 智能装备
1、做什么: 建设具身智能专用的数据闭环基础设施,覆盖"采集→传输→处理→存储→标注→评测→回流"全链路,支撑多模态时序数据的高效流转与价值提炼。 2、核心职责: - 端云一体数据闭环架构设计与搭建,支持断点续传、弱网同步 - 多模态时序数据处理引擎(清洗、微秒级时序对齐、质量评估) - 数据血缘追踪与版本管理(数据集版本管理、模型-数据版本绑定、A/B 对比与回滚) - 数据质量评价体系与可视化调试工具建设
职位简介: 关键字:多模态湖仓、数据资产、数据治理与服务 如果说大模型是AI时代的“大脑”,那么数据就是它的“神经元”与“血液”。我们相信,模型效果的边界,由数据基建的上限决定。在这个岗位上,你不是简单的“查数工具人”,而是负责构建支撑千亿参数模型训练的自研数据基座。你将直面EB级数据的实时流转、清洗与配比难题,用极致的系统性能,缩短模型迭代的数据准备时间从“周”到“小时”。 工作职责: 1. 湖仓:设计AI场景的湖仓一体架构(Iceberg / Delta Lake / Hudi)处理 PB 级数据,主导多模态湖仓整体架构(结构化 + 非结构化 + 向量数据统一存储与访问);…
Java Scala Python 数据 通信 / 计算机 / IT
1.负责大数据需求开发工作,完成项目模块的交付。 2.负责对客户/公司内部等大数据需求方提供技术支持。 3.参与大数据平台的建设、运维以及性能调优。
Java Scala 分布式 数据 通信 / 计算机 / IT
主要方向:数据治理平台、数据编织、逻辑数据平台、虚拟数据湖、统一查询、数据Pipeline 一、岗位职责 1. 负责逻辑数据平台 / 虚拟数据湖核心模块研发,构建统一元数据、联邦查询、跨源数据服务能力。 2. 负责大数据查询引擎、任务调度、统一 SQL 网关、多引擎智能路由的设计、开发与性能优化。 3. 负责数据治理平台建设,包括元数据管理、数据血缘、数据权限、数据质量、数据服务等能力。 4. 深度参与 Spark 内核、SQL 优化、执行引擎、Shuffle、存算分离等方向研发与性能调优。 5. 负责数据ETL、数据集成、数据Pipeline管道的设计与实现,支撑离线 / 实时一体化数据处…
Java MyBatis Hadoop 数据 通信 / 计算机 / IT
1. 负责统一数据服务平台(OneService)的架构设计、研发与持续优化,构建公司级标准、高效、智能的数据消费入口,支持自然语言查询、报告生成等多种数据访问方式; 2. 规划并建设指标管理体系,包括指标定义、血缘、版本、生命周期等模块,打造规范化、工具化的指标生产与管理流程,保障口径一致与结果准确; 3. 持续提升平台的数据服务能力,支持 BI 报表、自助分析、API 调用、运营活动等多样化消费场景,推动数据在经营分析、运营决策中的智能化落地; 4. 探索并集成大语言模型(LLM)与语义建模能力,提升用户通过自然语言与数据交互的体验与效率,降低数据使用门槛;…
岗位职责 · 设计和优化大规模 Web 爬虫的 URL 发现与调度系统,持续扩大数据覆盖面 · 建设多因子抓取优先级体系,在有限资源下最大化高质量页面的获取效率 · 主导反爬对抗和动态渲染方案,提升核心站点的抓取成功率 · 建立数据质量评估闭环,从域名到页面的多层级质量管控 · 优化大规模数据处理管线的性能和稳定性 希望你具备以下经验 · 大规模搜索引擎或 Web 爬虫系统实战经验,做过百亿级以上 URL 池的全链路 · 深入理解全网 URL 发现的多种手段 · 熟悉主流反爬机制及对抗方案 · 扎实的分布式数据处理能力(Spark / Flink 等) 强烈加分 · 有大模型预训练语料采集和…
Python Java Scala 算法与AI 通信 / 计算机 / IT
面向 AI 时代的数据生产、数据治理与数据智能化场景,参与构建面向大模型训练、评测、标注、质量分析和数据飞轮的工程体系。你将不只是做传统数据开发,而是和 AI Agent、数据平台、算法模型一起,推动数据从“人工处理”走向“流程化、工程化、智能化”。 工作职责: 1.参与 AI 数据工程体系建设,包括数据采集、清洗、加工、质检、评测、回流等链路。 2.参与大模型 / 多模态 / OCR 等业务场景下的数据生产与质量提升工作。 3.结合 AI 工具和 Agent 能力,设计数据处理流程、规则、工具和反馈机制,提升数据生产效率。…
工作职责 面向AI 模型数据挖掘、样本筛选、特征探查场景,搭建数据挖掘服务平台,负责平台设计、功能迭代与落地,支撑模型训练前的数据探查、样本过滤、特征统计、离线分析等核心业务。 支撑 PB 级模型样本数据集,实现高并发特征查询、多维样本筛选、批量特征导出、样本统计分析,持续优化查询时延与吞吐,保障模型迭代的数据交付效率。 构建湖仓一体数据链路,打通上游样本数据接入、实时 / 离线计算、模型训练数据输出全流程,实现批流统一的样本数据管理。 深度开展内核调优、源码优化、生态组件开发;针对模型挖掘场景的大扫描、多维度过滤、高并发特征探查负载,优化查询优化器、存储层、缓存策略、分区调度,降低算力与存…
Hadoop Spark Flink 数据 芯片 / 半导体
1. 负责公司PB级自动驾驶全域数据平台的架构设计、规划与迭代,支撑多模态数据的实时/离线处理、AI训练与仿真验证。 2. 主导数据湖仓、车云一体平台的架构选型与技术落地,保障平台高可用、高性能与高稳定,驱动自动驾驶算法持续迭代。 3. 构建并推动数据治理、安全合规、资源优化体系,提升数据质量、处理效率与资源利用率,支撑模型泛化与系统验证。 4. 指导团队攻克数据处理、存储、调度等技术瓶颈,把控平台研发进度与架构风险,协同算法、车端等团队推进复杂项目落地。
• Support the development of data governance standards and contribute to building a data quality control platform based on Brunei’s data landscape. • Plan and drive the development of data engineering solutions that solutions balance functionality, and non-functional requirements. • Support the des…
银河通用 城市未标注
Java Scala Python 后端与架构 机器人 / 智能装备
岗位职责 负责 Elasticsearch 管理平台架构设计与研发,搭建多维度检索引擎底座,基于 Elasticsearch 设计、落地高性能数据检索产品,支撑复杂多条件、多维度混合检索业务需求。 参与大数据实时计算平台架构设计与开发,对接实时 / 离线数据源,构建数据接入、清洗、同步、索引构建全链路检索流水线。 深度理解业务检索场景,持续优化检索架构、查询策略,解决检索延迟、相关性、集群稳定性、容量规划等线上问题,推动检索平台持续迭代升级。 面向内部业务与外部客户提供检索技术支撑,定位并解决集群运维、查询性能、数据一致性各类问题,沉淀检索平台标准化能力。…
SQL Python Java 数据 通信 / 计算机 / IT
1. 构建与维护数据管道:设计并开发稳定、可扩展的批处理与实时数据管道,保障数据从采集、清洗到落库的全链路通畅。 2. 设计 ETL / ELT 流程:基于业务需求梳理数据流向,编写高效的抽取、转换、加载作业,沉淀标准化数据处理模板。 3. 优化数据仓库架构:以 Apache Doris 为核心参与数据仓库分层设计与建模,持续提升查询性能与存储效率;配合团队推进 湖仓一体(如 Apache Iceberg) 架构演进,逐步实现流批一体与存算分离。 4. 保障数据质量与一致性:构建统一指标/标签体系与数据语义层,解决数据口径与可发现性问题;…
1. 建设并维护平台数据仓库,完成用户、行为等数据的采集、清洗与建模;40% 2. 开发维护ETL任务,保障数据实时准确;30% 3. 负责大数据平台运维与组件调优,支撑数据产品与算法需求。30%
SQL Python Java 数据 通信 / 计算机 / IT
1. 构建与维护数据管道:设计并开发稳定、可扩展的批处理与实时数据管道,保障数据从采集、清洗到落库的全链路通畅。 2. 设计 ETL / ELT 流程:基于业务需求梳理数据流向,编写高效的抽取、转换、加载作业,沉淀标准化数据处理模板。 3. 优化数据仓库架构:以 Apache Doris 为核心参与数据仓库分层设计与建模,持续提升查询性能与存储效率;配合团队推进 湖仓一体(如 Apache Iceberg) 架构演进,逐步实现流批一体与存算分离。 4. 保障数据质量与一致性:构建统一指标/标签体系与数据语义层,解决数据口径与可发现性问题;…
Hadoop Spark Flink 数据 机器人 / 智能装备
大数据平台架构建设:负责机器人云平台大数据架构的设计、开发与优化,基于Hadoop、Spark、Flink等大数据技术栈,搭建稳定、高效、可扩展的数据存储与计算体系,支撑海量机器人运行数据的处理需求。 数据采集与预处理:主导机器人多模态数据(包括传感器数据、运行日志、交互记录等)的采集、清洗、转换与集成工作,制定标准化的数据采集规范,确保数据的准确性、完整性和时效性。 参与数据仓库、数据湖的设计与建设,进行数据建模,构建面向机器人业务场景的数据集市,为业务分析、算法训练提供高质量的数据支撑。 开发数据查询、分析与可视化工具,为业务团队、算法团队提供高效的数据服务接口,推动数据在机器人性能优化…