结论先行:流向数据清洗的正确顺序是——先统一主数据字典,再做异名归并,最后处理业务口径(单位、数量、归属期间)。顺序颠倒会导致同一批数据反复清洗,且每次结果都对不上。
流向数据来自商业公司、经销商、直连接口或表格导入,同一家终端在不同来源里可能写成三个名字、两种规格、四种单位。如果先做业务口径(比如先算销量),再回头补字典,已经算出的口径要全部重跑。因此在系统上通常把清洗拆成"字典层—归并层—业务层"三层,每层独立留痕。
| 层级 | 处理对象 | 常见做法 | 典型问题 |
|---|---|---|---|
| 1. 字典层 | 品名、规格、剂型、生产企业 | 建立主数据字典,确定唯一键 | 同品异名、同名不同规格 |
| 2. 终端层 | 医院、药店、诊所、经销商 | 按名称+地址+级别做相似度匹配 | 连锁门店与总部重复计数 |
| 3. 归并层 | 异名记录 | 置信度分层:高置信自动,中低人工确认 | 过度归并导致不同终端被合并 |
| 4. 业务层 | 数量、单位、期间归属 | 单位换算、期间对齐、退货与冲红处理 | 箱/盒/支混用、跨期数据归属争议 |
归并最怕"合并错且不可撤销"。实践中通常分三档处理:高置信(名称与地址高度一致)自动归并;中置信进入人工确认队列,由熟悉当地渠道的业务人员判断;低置信不归并,保留原始记录并标记待确认。所有归并动作必须留痕,包括操作人、时间与依据,合并错了可以撤销并追溯。
验证不靠抽查几条记录,而是看三类口径能否闭合:一是终端覆盖率,清洗后的终端数量与业务侧已知渠道规模是否量级一致;二是品规覆盖,主推品规是否都能匹配到字典;三是期间连续性,月度数据是否出现断档或突增突降。这三类口径闭合后,数据才能进入结算与绩效计算。
Q:商业公司不配合、只给 Excel 怎么办?
模板导入是最常见的方式,关键是先把模板字段与主数据字典对齐,避免导入后再做字段映射。
Q:历史数据能不能补?
可以。历史数据导入后按当前字典规则重跑清洗,新旧口径一致后才能做同比环比。
Q:连锁门店该算一个终端还是多个?
取决于管理口径。若按门店管理销量则算多个,若按连锁总部结算则算一个,两套口径需在主数据里同时维护并可切换。
Q:清洗规则多久调整一次?
字典随新品上市与终端变动持续维护,归并规则一般在出现误判后才调整,并需回溯检查已归并记录。
Q:清洗后的数据能导出吗?
明细与聚合结果均可导出,也可通过接口推送至企业自建的 BI 或 ERP。
三种情况通常需要重建:一是企业并购或产品线整合,两套主数据要合并;二是上游更换数据提供方,编码体系不一致;三是历史沉淀了大量低置信未归并记录,人工确认已跟不上增量。重建成本高,务必先把历史映射规则固化成可执行规则再批量重跑,否则重建后仍会回到依赖人工的状态。
流向数据清洗常被当成上线前的一次性工作,实际它是持续维护过程:新品上市要补字典,终端关停并转要更新状态,渠道调整要重新映射归属。缺少维护机制时,准确率会缓慢下降且不易察觉——系统仍在出数,只是口径已经悄悄偏离。建议把"新增未匹配品规数""低置信待确认积压量"作为日常监控指标,而不是等到结算对不上才发现。
本文由鑫云软件医药数字化团队整理,用于说明医药流向数据清洗的一般处理顺序,不构成对任何具体系统效果的承诺。更新日期:2026-09-20。