返回作品

短视频用户行为数据分析与健康度评估

创建于 2026 年 2 月 27 日

标签
  • Python
  • Pandas
  • scikit-learn
  • Streamlit
  • FastAPI
  • SQLAlchemy

项目介绍

短视频平台的用户行为数据蕴含丰富的使用习惯信息,但原始记录通常存在列名不统一、缺失值、异常时长、时间格式杂乱等问题,难以直接用于健康评估。本项目围绕「观看行为 → 健康画像」这一主线,把原始行为数据组织为可分析的标准化数据集,并给出每位用户每日的健康度结论。

项目是一个完整的端到端分析管线:从示例数据生成、数据清洗、特征工程,到规则分级、健康评分、模型训练评估,再到 Streamlit 与 FastAPI 双页面可视化,每个环节都有独立脚本与清晰输出,既能跑通演示流程,也能替换真实数据直接使用。项目内置的示例数据包含约 8000 条行为记录,字段覆盖观看时长、观看时间戳、互动类型、内容标签、设备、性别、年龄与地区。

核心功能

  • 用户日粒度特征工程:以「用户 × 日期」为粒度聚合出 22 个特征,包括日总观看时长、平均观看时长、观看次数、互动次数与互动率、夜间/周末观看时长与占比、内容标签种类数、内容香农熵与头部标签占比(内容集中度),以及基于 30 分钟间隔切分会话后的最长连续观看时长,为后续评估提供完整的行为画像。

  • 健康度规则评估与评分:双通道评估体系。规则分级基于「分位数自适应 + 业务上下限」的混合阈值,判定偏保守——风险档要求重度总时长、深夜使用、长会话、内容单一、高集中度五类信号中至少 3 项且包含核心风险;健康分则按观看时长(35%)、夜间占比(25%)、内容集中度(20%)、最长会话(20%)加权扣分,映射到健康(80-100)、亚健康(60-79)、风险(0-59)三档。

  • 双页面可视化与推理接口:Streamlit 提供指标卡、用户筛选、规则等级/评分等级/健康分/模型预测四联指标、关键风险指标与历史记录表格;FastAPI 提供可视化看板(健康分布饼图、评分趋势、地区对比、等级雷达图)、用户列表分页/搜索/筛选、用户详情(含模型预测与近 30 天历史)、/api/predict 在线推理接口与 /api/model/metrics 指标接口,并附带管理后台:上传 CSV 原始数据、一键启动清洗/特征/评估/全流程任务、实时查看任务日志与系统状态。

功能截图

首页概览

短视频用户行为健康度评估系统首页概览

用户查询

短视频用户行为健康度评估系统用户查询页面

健康评估

短视频用户健康度评估页面

可视化结果

短视频用户行为数据可视化结果