海
数据要素层 · AI 训练数据服务
海天瑞声 (Haitian Ruisheng)
📈 688787:SH🌍 中国
提供语音、视觉、自然语言等 AI 模型训练所需的高质量数据集和定制化标注服务。
⚔️ 核心护城河
国内稀缺的具备多语种、多模态高质量数据积累的企业,深度参与国内大模型语料库建设标准,并率先发布具身智能数据工程化服务平台。
公司概况
海天瑞声成立于 2005 年,总部位于北京,是国内最早从事 AI 训练数据服务的公司之一。2021 年在科创板上市,成为国内"AI 数据第一股"。
海天瑞声的核心业务是为 AI 模型提供"食物"——高质量的标注数据。从早期的语音识别语料库(方言、多语种)到如今的 LLM 指令微调(SFT)数据和 RLHF 偏好数据,海天瑞声的业务覆盖了 AI 训练数据的全品类。在具身智能(机器人)兴起后,公司率先发布了针对机器人训练的具身数据平台。
核心业务
智能语音数据(传统优势)
覆盖超过 200 种语言和方言的语音识别语料库,是讯飞、百度、阿里等公司语音产品的底层数据支撑。
LLM 训练数据
提供 LLM 指令微调(SFT)数据集、RLHF 偏好排序数据集,以及针对特定行业(法律、医疗)的领域数据。
具身智能数据
新推出的数据工程化服务平台,提供机器人所需的视觉、力觉、动作捕捉等多模态数据采集和标注服务。
市场格局
| 维度 | 数据 |
|---|---|
| 国内 AI 数据服务 | 头部企业 |
| 主要竞对 | Scale AI、合合信息 |
| 核心客户 | 百度、阿里、讯飞、国内大模型公司 |
风险与总结
海天瑞声是中国版的 Scale AI。在国内大模型研发热潮中,高质量中文语料的标注和建设需求旺盛。海天瑞声在语音和 NLP 领域的数据积累构成了其核心壁垒。