读取输入
输入是一张包含商品 ID 的表格,以及一个目标模特参考照片文件夹。
目标模特即将离职,需要对其历史出镜商品图片进行排查和下架处理。业务侧提供包含商品 ID 的表格及目标模特参考照片,项目目标是逐一核对 PIM 系统中对应商品的资源图和详情页,判断是否仍存在该模特照片,同时确认详情页是否存在“1111”占位情况,为后续图片下架和人工复核提供依据。
工具通过 Playwright 操作 PIM 系统,自动进入渠道商品详情页,采集图片链接并下载缓存,再用人脸识别模型比对目标模特,最后把判断结果写回 Excel。
输入是一张包含商品 ID 的表格,以及一个目标模特参考照片文件夹。
登录 PIM 后自动进入渠道商品,采集资源图和详情页图片链接。
使用 MTCNN 做人脸检测,FaceNet/InceptionResnetV1 生成人脸特征并计算相似度。
写回是否含目标模特、最高相似度、人脸图片数、URL 数、备注和 1111 占位判断。
业务侧只需要提供商品 ID 表和目标模特照片,输出表用于下架判断和人工复核。
输入表中包含商品 ID,工具会生成对应商品链接,并逐条进入 PIM 系统核查资源图和详情页。
除了图片人脸识别,工具还会检测详情页是否出现“1111”占位,作为独立核查字段写入输出表。
基于 Python 和 Playwright 登录并操作 PIM 商品管理系统,按商品 ID 自动进入渠道商品详情页,采集资源图和详情页图片链接并下载缓存。
使用 MTCNN 进行人脸检测,FaceNet/InceptionResnetV1 生成人脸特征,与目标模特参考图进行相似度比对,默认阈值设置为 0.8。
将识别结果、最高相似度、检测到人脸的图片数、URL 数、备注和详情页 1111 占位判断写回输出 Excel,方便业务侧复核和下架处理。
为保证长批次任务可持续运行,工具支持断点续跑、逐行保存、图片并发下载、缓存清理,并统一使用 CPU 模式,便于在同事电脑上直接运行。
难点主要集中在长批次运行稳定性、跨设备可用性和图片识别效率上。
如果用户误删结果表或关闭终端,重跑全部商品效率很低。因此代码运行时维护缓存数据,并支持从上一次结尾继续跑。
同事电脑可能没有 Python 环境、依赖包或 GPU。为降低交付门槛,工具统一设置为 CPU 模式,速度不会慢太多,也更容易打包分发。
资源图和详情页图片数量较多,逐张下载会影响速度,因此设置一批四张图片并发下载,同时使用少量清晰的目标模特照片提高比对效率。
详情页 1111 占位判断准确率很高;人脸识别准确率依赖模型和阈值设置,当前阈值为 0.8,并保留最高相似度和备注用于人工复核,9000条ID中仅有20多条需要人工核验。
在阈值 0.8 下,工具完成 9000 多条商品 ID 的批量核查,人脸识别结果整体稳定,仅有 20 多条需要人工复核修正;详情页 1111 占位判断全部正确。