10 CATEGORY · MEDIA

内容 & AI 能力

OCR、人脸、语音、翻译等 AI 能力 API

这一类指的是单点、可直接调用的 AI 能力接口:文字识别(OCR)、人脸与人体识别、语音识别与合成、翻译、图像处理、内容审核等。与通用大模型不同,它们针对特定任务做了专门优化,在各自领域内通常准确率更高、延迟更低、成本也更可控。

OCR 与内容审核是使用面最广的两类。OCR 的典型价值在于把用户的手工填表替换成拍照自动填充,能显著降低表单流失;内容审核则是所有允许用户发布内容的产品在国内的合规前提——社区、直播、社交、电商评价都在范围内,这是法定义务而非产品选择。

需要特别提示的是合规边界。人脸、声纹属于生物识别信息,身份证信息属于敏感个人信息,中国的相关法规对其收集、传输与存储有严格要求:必须取得用户单独同意、明示用途、采取加密措施,且不应超期留存。为排查问题长期保存原始图像,是这类项目中常见且风险很高的做法。

选型要点

专用能力优于通用模型
身份证识别、票据识别、活体检测这类任务,专用接口的准确率与成本通常优于让通用大模型来做。
人脸比对必须配活体
没有活体检测的人脸比对可以被一张照片攻破。凡涉及身份确认而非仅做人脸检测的场景,活体都是必选项。
审核不等于免责
机器审核无法做到完全准确,合规责任仍在业务方。重要场景需配置人工复审并保留处置记录以备核查。
注意资质门槛
人脸核身等涉及权威库比对的能力属于强资质产品,需要企业认证并签署协议,个人开发者无法开通。
§ 10 · MEDIA

内容 & AI 能力

10 条

No.109旷视 Face++

人脸识别、活体检测、人脸比对、人脸搜索、人证核验
faceplusplus.com.cn

No.110有道 AI API

翻译 API、OCR、语音合成、词典数据
翻译OCR教育
ai.youdao.com

No.113云知声

语音与语言 AI 能力,物联网与医疗场景积累深
语音物联网医疗
unisound.com

No.114思必驰

对话式 AI 与语音交互能力,车载与智能硬件方向
语音车载对话
aispeech.com