Skip to content

blankxxc/hot_dot

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

4 Commits
 
 
 
 
 
 
 
 

Repository files navigation

Hot Dot - 热点新闻爬虫 & 公众号爆文发现工具

自动爬取多平台热点新闻并智能聚类分析,同时从搜狗微信搜索中发现少粉公众号爆文,为内容创作者提供选题参考。

功能

1. 新闻热点聚合 (news_hot_crawler.py)

从 6 大主流平台爬取实时热点,自动聚类归类:

  • 百度热搜 - 实时热搜榜
  • 微博热搜 - 热搜话题
  • 知乎热榜 - 热门问题
  • 今日头条 - 热点排行
  • 网易新闻 - 热点推荐
  • 澎湃新闻 - 热门新闻

核心特性:

  • 基于 jieba 分词 + TF-IDF + 层次聚类(AgglomerativeClustering)自动将相似新闻归组
  • 预定义 18 个分类(中美关系、科技互联网、财经金融等),两级分类精准归类
  • 默认爬取前一天(day-1)新闻,支持日期过滤
  • 输出可读的文本报告 + 结构化 JSON 数据

2. 公众号少粉爆文发现 (wechat_viral_crawler.py)

基于搜狗微信搜索,按热点分类关键词搜索公众号文章,筛选出非头部大号发布的热点文章:

  • 覆盖 15 个热点分类,自动生成搜索关键词
  • 内置大号黑名单(60+ 头部账号),过滤后保留小号爆文
  • 可联动 news_hot_crawler.py 的输出,从当日热点中动态提取补充搜索词
  • 按标题去重,按日期过滤

快速开始

安装依赖

pip install requests beautifulsoup4 jieba scikit-learn

运行

# 1. 先爬取热点新闻
python news_hot_crawler.py

# 2. 再爬取公众号爆文(会自动读取上一步的热点 JSON 补充搜索词)
python wechat_viral_crawler.py

输出示例

运行后会在项目目录下生成:

X月X日热点新闻.txt      # 热点新闻文本报告
X月X日热点新闻.json     # 热点新闻结构化数据
X月X日公众号爆文.txt    # 公众号爆文文本报告
X月X日公众号爆文.json   # 公众号爆文结构化数据

技术栈

  • Python 3
  • requests + BeautifulSoup4 - 网页爬取与解析
  • jieba - 中文分词
  • scikit-learn - TF-IDF 向量化 + 层次聚类

注意事项

  • 搜狗微信搜索有反爬机制,频繁请求可能触发验证码
  • 微博热搜需要有效的 Cookie,失效后需更新
  • 建议在国内网络环境下运行,工具已内置绕过代理配置

About

No description, website, or topics provided.

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

No releases published

Packages

 
 
 

Contributors

Languages