
覆盖计算机视觉、语音识别、自然语言处理、多模态、智能驾驶、智能体等全领域, 拥有完整授权链,支持定制化采集与标注,为AI模型训练提供高质量数据燃料
覆盖AI训练全场景需求,点击快速筛选对应数据集
覆盖深度搜索、数据分析、行业调研等办公场景,完整记录多轮推理思考与工具调用链,可用于Agent规划能力分析、工具选择策略研究及质量评估。
覆盖深度搜索、数据分析、行业调研等办公场景,完整记录多轮推理思考与工具调用链,可用于Agent规划能力分析、工具选择策略研究及质量评估。
411人约262小时日本儿童语音数据,收录147,668句朗读语音。话者为6岁至13岁日本儿童,按低年级和高年级分类收录,男女比例均衡。
411人约262小时日本儿童语音数据,收录147,668句朗读语音。话者为6岁至13岁日本儿童,按低年级和高年级分类收录,男女比例均衡。
第一人称全身操作多模态数据集,面向具身智能精细操作训练,覆盖多类真实场景,包含高清双目视频、全关节姿态与高密度语义标注。
第一人称全身操作多模态数据集,面向具身智能精细操作训练,覆盖多类真实场景,包含高清双目视频、全关节姿态与高密度语义标注。
面向大语言模型在长文本理解与复杂推理任务的核心能力短板,涵盖中/英/韩三语种、7500条高质量训练数据,支持跨段落多跳推理评测。
面向大语言模型在长文本理解与复杂推理任务的核心能力短板,涵盖中/英/韩三语种、7500条高质量训练数据,支持跨段落多跳推理评测。
包含45个真实外呼场景的4500组多轮对话质量评测样本,覆盖家电、消费电子及零售行业,涉及售前咨询、售后回访、退换货等完整业务环节。
包含45个真实外呼场景的4500组多轮对话质量评测样本,覆盖家电、消费电子及零售行业,涉及售前咨询、售后回访、退换货等完整业务环节。
意大利语金融领域口语化语音数据,涵盖各种金融类专业名词,反映真实世界互动情境。标注文本内容、说话人身份性别等多种属性。
意大利语金融领域口语化语音数据,涵盖各种金融类专业名词,反映真实世界互动情境。标注文本内容、说话人身份性别等多种属性。
阿拉伯语金融领域口语化语音数据,涵盖各种金融类专业名词,标注文本内容、说话人身份性别等属性,多家AI公司验证有效。
阿拉伯语金融领域口语化语音数据,涵盖各种金融类专业名词,标注文本内容、说话人身份性别等属性,多家AI公司验证有效。
覆盖中国50+城市真实道路场景,包含激光雷达点云、图像、毫米波雷达多传感器融合数据,标注3D目标检测、车道线、可行驶区域等。
覆盖中国50+城市真实道路场景,包含激光雷达点云、图像、毫米波雷达多传感器融合数据,标注3D目标检测、车道线、可行驶区域等。
涵盖不同年龄、种族、光照条件的人脸图像数据,支持人脸检测、关键点定位、人脸识别、活体检测等多项CV任务训练与评测。
涵盖不同年龄、种族、光照条件的人脸图像数据,支持人脸检测、关键点定位、人脸识别、活体检测等多项CV任务训练与评测。
2000人普通话高质量朗读语音数据,覆盖南北各地方言口音,男女比例均衡,年龄段分布均匀,适用于中文语音识别模型训练。
2000人普通话高质量朗读语音数据,覆盖南北各地方言口音,男女比例均衡,年龄段分布均匀,适用于中文语音识别模型训练。
5000例胸部CT影像,包含肺结节、肺炎、肺癌等多病种标注,由三甲医院放射科医生审核,适用于医学影像AI模型训练。
5000例胸部CT影像,包含肺结节、肺炎、肺癌等多病种标注,由三甲医院放射科医生审核,适用于医学影像AI模型训练。
覆盖服装、数码、家居、食品等200+商品类目,共500万张商品图片,带层级分类标签,适用于电商搜索推荐、图像分类模型训练。
覆盖服装、数码、家居、食品等200+商品类目,共500万张商品图片,带层级分类标签,适用于电商搜索推荐、图像分类模型训练。
覆盖中/英/日/韩等20+语种的专业级TTS语料,由专业播音员录制,情感丰富,包含新闻、对话、故事等多种风格,适用于语音合成模型训练。
覆盖中/英/日/韩等20+语种的专业级TTS语料,由专业播音员录制,情感丰富,包含新闻、对话、故事等多种风格,适用于语音合成模型训练。
100万+真实客服多轮对话数据,覆盖售前咨询、售后处理、投诉建议等全场景,带意图分类与情感标注,适用于对话系统训练。
100万+真实客服多轮对话数据,覆盖售前咨询、售后处理、投诉建议等全场景,带意图分类与情感标注,适用于对话系统训练。
多视角人体动作捕捉数据集,包含100+表演者、500+动作序列,覆盖日常动作、运动、手势等,提供2D/3D关键点标注。
多视角人体动作捕捉数据集,包含100+表演者、500+动作序列,覆盖日常动作、运动、手势等,提供2D/3D关键点标注。
葡萄牙语客服中心真实语音数据,涵盖银行、保险、电信等行业,带文本转写及说话人标注,适用于呼叫中心AI应用训练。
葡萄牙语客服中心真实语音数据,涵盖银行、保险、电信等行业,带文本转写及说话人标注,适用于呼叫中心AI应用训练。
包含身份证、银行卡、营业执照、发票、护照等20+证照类型,100万张图片带文字位置与内容标注,适用于各类OCR场景。
包含身份证、银行卡、营业执照、发票、护照等20+证照类型,100万张图片带文字位置与内容标注,适用于各类OCR场景。
法语新闻播报风格朗读语料,由专业法语播音员录制,涵盖时政、财经、科技、体育等多个领域,文本标注完整。
法语新闻播报风格朗读语料,由专业法语播音员录制,涵盖时政、财经、科技、体育等多个领域,文本标注完整。
覆盖商场、地铁、街道等10+监控场景,5000+行人、20万张图像,跨摄像头关联标注,适用于行人ReID模型训练。
覆盖商场、地铁、街道等10+监控场景,5000+行人、20万张图像,跨摄像头关联标注,适用于行人ReID模型训练。
俄语母语者日常口语对话数据,覆盖购物、旅游、餐饮、工作等场景,1000+说话人,带文本转写,适用于语音识别和翻译模型。
俄语母语者日常口语对话数据,覆盖购物、旅游、餐饮、工作等场景,1000+说话人,带文本转写,适用于语音识别和翻译模型。
通用领域中文知识图谱数据,包含500万+实体、2000万+三元组关系,覆盖人物、地点、组织机构、事件等多类型实体。
通用领域中文知识图谱数据,包含500万+实体、2000万+三元组关系,覆盖人物、地点、组织机构、事件等多类型实体。
高速公路场景激光雷达点云数据,覆盖全国20+高速路段,包含车辆、行人、交通标志等标注,适用于高速场景自动驾驶感知。
高速公路场景激光雷达点云数据,覆盖全国20+高速路段,包含车辆、行人、交通标志等标注,适用于高速场景自动驾驶感知。

6大定制采集能力 + 专业数据顾问团队,从需求沟通到交付验收全流程服务, 精准匹配您的模型训练数据需求
多传感器融合采集、道路实况采集、交通场景采集,满足自动驾驶感知需求
多视角动作捕捉、手势识别、面部表情、具身智能操作轨迹数据采集
多语种、多方言、多场景语音采集,覆盖近场/远场/降噪等多种录音条件
覆盖200+语种和方言,全球范围采集能力,小语种语料定制
多场景图像/视频采集,支持特定人群、特定场景、特定设备定制采集
图文、音视频、传感器等多模态同步采集,支持复杂场景多源数据融合
资深数据顾问1对1对接,明确数据类型、规模、标注要求、交付周期
制定数据采集方案、标注规范、质量标准、安全合规方案
专业采集团队按方案执行,实时进度追踪,确保数据质量
Metis智能标注平台+三级质检体系,确保标注精准度99.5%+
按合同约定标准验收,支持抽检、全检、第三方评测
交付后30天免费补标,长期技术支持与数据迭代服务
专业顾问1对1服务,24小时内响应
4大核心优势,为AI模型训练提供可靠数据保障
1500+版权数据集,覆盖200+语种,总量超10PB,满足各类AI训练需求
严格遵循GDPR/CCPA/PIPL,所有数据均有完整授权链,法务团队保驾护航
根据模型需求定制化采集,场景、人群、语种均可精确匹配
三级质检体系+AI辅助标注,标注准确率99.5%+,专业团队百万级处理能力

严格遵循全球数据保护法规,建立了完善的数据合规管理体系。 所有数据集均有完整授权链路,从采集、存储到使用全流程可追溯, 确保客户的数据安全与合规无忧。
