非结构化数据没有预定义的格式。文本文件、电子邮件、视频、录音、图像和社交媒体帖子都属于此类。这类数据不符合行和列的格式,也不遵循任何模式。它是企业创建的数据中绝大多数。据估计,非结构化数据占企业所有数据的 80% 到 90%。由于传统工具难以处理,其中大部分数据都处于闲置状态。
挑战在于数据提取。要分析非结构化数据,首先必须对其进行结构化处理。自然语言处理(NLP)从文本中提取实体、情感和主题。计算机视觉识别图像中的物体和场景。语音识别转录音频。每种技术都将非结构化数据转换为可分析的结构化表示。但这种转换并不完美。NLP 模型会忽略细微差别和讽刺。视觉模型会混淆相似的物体。转录错误会不断累积。结构化输出只是近似值,而非完美反映。尽管困难重重,非结构化数据仍然蕴含着巨大的价值。客户电子邮件揭示了投诉和请求。支持工单显示了产品问题的模式。通话录音捕捉到了文本无法捕捉到的语气和情感。能够挖掘非结构化数据的组织可以获得竞争对手无法获得的洞察。工具正在不断改进。但挑战依然存在。
非结构化数据类型
- 文本——文档、电子邮件、社交媒体帖子
- 图片——照片、图表、扫描件
- 音频——录音、通话、音乐
- 视频——影像、直播、演示文稿
- 二进制文件——没有定义文本格式的文件
非结构化数据是现代分析的原材料。要从中提取价值,就需要构建原本不存在的结构。
Comments
No comments yet. Be the first to share a thought.
Leave a comment