自动爬取多平台热点新闻并智能聚类分析,同时从搜狗微信搜索中发现少粉公众号爆文,为内容创作者提供选题参考。
从 6 大主流平台爬取实时热点,自动聚类归类:
- 百度热搜 - 实时热搜榜
- 微博热搜 - 热搜话题
- 知乎热榜 - 热门问题
- 今日头条 - 热点排行
- 网易新闻 - 热点推荐
- 澎湃新闻 - 热门新闻
核心特性:
- 基于 jieba 分词 + TF-IDF + 层次聚类(AgglomerativeClustering)自动将相似新闻归组
- 预定义 18 个分类(中美关系、科技互联网、财经金融等),两级分类精准归类
- 默认爬取前一天(day-1)新闻,支持日期过滤
- 输出可读的文本报告 + 结构化 JSON 数据
基于搜狗微信搜索,按热点分类关键词搜索公众号文章,筛选出非头部大号发布的热点文章:
- 覆盖 15 个热点分类,自动生成搜索关键词
- 内置大号黑名单(60+ 头部账号),过滤后保留小号爆文
- 可联动
news_hot_crawler.py的输出,从当日热点中动态提取补充搜索词 - 按标题去重,按日期过滤
pip install requests beautifulsoup4 jieba scikit-learn# 1. 先爬取热点新闻
python news_hot_crawler.py
# 2. 再爬取公众号爆文(会自动读取上一步的热点 JSON 补充搜索词)
python wechat_viral_crawler.py运行后会在项目目录下生成:
X月X日热点新闻.txt # 热点新闻文本报告
X月X日热点新闻.json # 热点新闻结构化数据
X月X日公众号爆文.txt # 公众号爆文文本报告
X月X日公众号爆文.json # 公众号爆文结构化数据
- Python 3
- requests + BeautifulSoup4 - 网页爬取与解析
- jieba - 中文分词
- scikit-learn - TF-IDF 向量化 + 层次聚类
- 搜狗微信搜索有反爬机制,频繁请求可能触发验证码
- 微博热搜需要有效的 Cookie,失效后需更新
- 建议在国内网络环境下运行,工具已内置绕过代理配置