GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。
开发介绍
项目起源
开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文――《基于文本及符号密度的网页正文提取方法》)
这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。
项目现状
在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。
目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。
本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。
本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。
邦世EasyVMS电脑端是一款非常监控软件,它的页面简洁,功能强大,可一键控制多个网络摄像头,并且还能查看直播和回放记录等,并且还能调查异常数据,感兴趣的朋友不要错过了,欢迎大
medibang paint pro(漫画插画制作软件),medibangpaintpro是一款来自日本的漫画制作软件,支持多平台,完全免费,作为一款专业漫画插画绘图软件,可以让你制作出精美的漫画插画,易于画幅分割,并具备屏幕调色功能,软件还有大量现成的素材,让你制作漫画更为高效!,您可
Zortam Mp3 Media Studio是一个MP3音乐文件管理的集成工具,它简单好用,功能全面,具备很高的实用性。Zortam Mp3 Media Studio Pro是个全能的mp3软件,它可以播放mp3,编辑mp3的ID3标签,也支持M3U歌曲
小说规则捕捉器,小说规则捕捉器能通过小说网站的html网页源代码,分析关键信息的规则进行书籍捕捉,最终输出捕捉到的书籍(支持txt、ePub、zip格式输出),您可以免费下载。
AcFunSubFilter是一款字幕过滤器,AcFunSubFilter可以帮助用户将视频字幕进行筛选,可以保留指定的字幕或者删除指定的字幕,有需要的用户可以下载。 基本简介 在下载了弹幕之后,却发现在神
图片爬取工具(CrawlWorm Picture)是一款功能强大的图片爬取工具,软件支持对任意网站的图片爬取和下载功能,主要运用于图片站使用,软件链接数据库,直接将某个站的图片全部下载并进行