文档章节

php解析html类库simple_html_dom

阳建
 阳建
发布于 2015/12/21 13:56
字数 1524
阅读 47
收藏 0
点赞 0
评论 3

下载地址: https://github.com/samacs/simple_html_dom

一直以来使用php解析html文档树都是一个难题。Simple HTML DOM parser 帮我们很好地解决了这个问题。可以通过这个php类来解析html文档,对其中的html元素进行操作 (PHP5+以上版本)。

解析器不仅仅只是帮助我们验证html文档;更能解析不符合W3C标准的html文档。它使用了类似jQuery的元素选择器,通过元素的 id,class,tag等等来查找定位;同时还提供添加、删除、修改文档树的功能。当然,这样一款强大的html Dom解析器也不是尽善尽美;在使用的过程中需要十分小心内存消耗的情况。不过,不要担心;本文中,笔者在最后会为各位介绍如何避免消耗过多的内存。

开始使用

上传类文件以后,有三种方式调用这个类:

从url中加载html文档

从字符串中加载html文档

从文件中加载html文档

<?php
// 新建一个Dom实例
$html = new simple_html_dom();
 
// 从url中加载
$html->load_file('http://www.cnphp.info/php-simple-html-dom-parser-intro.html');
 
// 从字符串中加载
$html->load('<html><body>从字符串中加载html文档演示</body></html>');
 
//从文件中加载
$html->load_file('path/file/test.html');
?>




如果从字符串加载html文档,需要先从网络上下载。建议使用cURL来抓取html文档并加载DOM中。

查找html元素

可以使用find函数来查找html文档中的元素。返回的结果是一个包含了对象的数组。我们使用HTML DOM解析类中的函数来访问这些对象,下面给出几个示例:

<?php
 
//查找html文档中的超链接元素
$a = $html->find('a');
 
//查找文档中第(N)个超链接,如果没有找到则返回空数组.
$a = $html->find('a', 0);
 
// 查找id为main的div元素
$main = $html->find('div[id=main]',0);
 
// 查找所有包含有id属性的div元素
$divs = $html->find('div[id]');
 
// 查找所有包含有id属性的元素
$divs = $html->find('[id]');
?>




还可以使用类似jQuery的选择器来查找定位元素:

<?php
// 查找id='#container'的元素
$ret = $html->find('#container');
 
// 找到所有class=foo的元素
$ret = $html->find('.foo');
 
// 查找多个html标签
$ret = $html->find('a, img');
 
// 还可以这样用
$ret = $html->find('a[title], img[title]');
?>



复制代码

解析器支持对子元素的查找

<?php
 
// 查找 ul列表中所有的li项
$ret = $html->find('ul li');
 
//查找 ul 列表指定class=selected的li项
$ret = $html->find('ul li.selected');
 
?>




如果你觉得这样用起来麻烦,使用内置函数可以轻松定位元素的父元素、子元素与相邻元素

<?php
// 返回父元素
$e->parent;
 
// 返回子元素数组
$e->children;
 
// 通过索引号返回指定子元素
$e->children(0);
 
// 返回第一个资源速
$e->first_child ();
 
// 返回最后一个子元素
$e->last _child ();
 
// 返回上一个相邻元素
$e->prev_sibling ();
 
//返回下一个相邻元素
$e->next_sibling ();
?>




元素属性操作

使用简单的正则表达式来操作属性选择器。

[attribute] – 选择包含某属性的html元素

[attribute=value] – 选择所有指定值属性的html元素

[attribute!=value]- 选择所有非指定值属性的html元素

[attribute^=value] -选择所有指定值开头属性的html元素

[attribute$=value] 选择所有指定值结尾属性的html元素

[attribute*=value] -选择所有包含指定值属性的html元素

在解析器中调用元素属性

在DOM中元素属性也是对象:

<?php
// 本例中将$a的锚链接值赋给$link变量
$link = $a->href;
?>



或者:

<?php
$link = $html->find('a',0)->href;
?



每个对象都有4个基本对象属性:

tag – 返回html标签名

innertext – 返回innerHTML

outertext – 返回outerHTML

plaintext – 返回html标签中的文本

在解析器中编辑元素

编辑元素属性的用法和调用它们是类似的:


<?php
//给$a的锚链接赋新值
$a->href = 'http://www.cnphp.info';
 
// 删除锚链接
$a->href = null;
 
// 检测是否存在锚链接
if(isset($a->href)) {
//代码
}
?>




解析器中没有专门的方法来添加、删除元素,不过可以变通一下使用:



<?php
 
// 封装元素
$e->outertext = '<div class="wrap">' . $e->outertext . '<div>';
 
// 删除元素
$e->outertext = '';
 
// 添加元素
$e->outertext = $e->outertext . '<div>foo<div>';
 
// 插入元素
$e->outertext = '<div>foo<div>' . $e->outertext;
?



保存修改后的html DOM文档也非常简单:

<?php  $doc = $html;  // 输出  echo $doc;  ?>

如何避免解析器消耗过多内存

在本文的开篇中,笔者就提到了Simple HTML DOM解析器消耗内存过多的问题。如果php脚本占用内存太多,会导致网站停止响应等一系列严重的问题。解决的方法也很简单,在解析器加载html文档并 使用完成后,记得清理掉这个对象就可以了。当然,也不要把问题看得太严重了。如果只是加载了2、3个文档,清理或不清理是没有多大区别的。当你加载了5个 10个甚至更多的文档的时候,用完一个就清理一下内存绝对是对自己负责啦^_^

<?php $html->clear(); ?>

本文转载自:http://www.cnphp.info/php-simple-html-dom-parser-intro.html

共有 人打赏支持
阳建

阳建

粉丝 20
博文 2
码字总数 968
作品 9
深圳
CTO(技术副总裁)
加载中

评论(3)

shawnking
shawnking

引用来自“狮子的魂”的评论

这个鬼东西有不少bug,上次用着一大部分标签属性不见了,写了issue没人理,还是哥自己修复的!
https://github.com/sunra/php-simple-html-dom-parser/issues/21
鑫哥遇到的那个bug,上次我跟唐攀也遇到了!后面改源码解决的
阳建
阳建
确实,貌似没有维护了。。。
狮子的魂
狮子的魂
这个鬼东西有不少bug,上次用着一大部分标签属性不见了,写了issue没人理,还是哥自己修复的!
https://github.com/sunra/php-simple-html-dom-parser/issues/21

暂无文章

JAVA知识点随心记

1.Switch case具体的支持类型? Q:支持byte、short、char、int基本类型,枚举类型和String类型(JDK7以上支持),四种基本类型的包装类型也支持,但是原因在于触发了自动拆箱,将包装类型拆成了基本...

勤奋的蚂蚁
13分钟前
0
0
NoSQL

一、NoSQL介绍 NoSQL属于非关系型数据,mysql属于关系型数据库。 对于关系型数据库来说,是需要把数据存储到库、表、行、字段里,查询的时候根据条件一行一行地去匹配,当数据量非常大的时候...

人在艹木中
18分钟前
0
0
第17章MySQL主从配置

mysql安装总结 mysql主从准备工作: 准备两台机器,每台机器安装msyql服务,并启动mysql服务 mysql详细安装 1.首先下载二进制免编译的包,下载到/usr/local/src/目录下 2.解压压缩包 3.解压完...

Linux学习笔记
22分钟前
0
0
Redis高可用及分片集群

一、主从复制 使用异步复制 一个服务器可以有多个从服务器 从服务器也可以有自己的从服务器 复制功能不会阻塞主服务器 可以通过服务功能来上主服务器免于持久化操作,由从服务器去执行持久化...

Java大蜗牛
25分钟前
0
0
前端面试题汇总

最近在复习,准备找工作了,特此总结一下前端的相关知识。 1.获取浏览器URL中查询字符的参数: function getQuery(name){    var reg = new RegExp("(^|&)"+name+"=([^&]*)"(&|$));...

凛冬来袭
59分钟前
0
0
可持续发展的学习道路

与其要求别人,不如提升自己 内心渴望进步 经常做出改变现有模式,不断学习 寻找资源,整合资源,不断熟练这种模式 渠道很重要 先打开新世界的航路

狮子狗
今天
0
0
apollox-lua开源项目 示例codepen2

今天在示例上增加了几个功能, 首先添加js array的标准库。 所有js array的方法目前都支持了。 添加查看code模式。 点击查看code可以看到生成的lua代码。默认web模式需要把标准库连接进来, ...

钟元OSS
今天
0
0
javascript性能优化之避免重复工作

javascript最重要也最根本的性能优化标准之一是避免工作,避免工作又包括两点,第一,不做不必要的工作,第二,不做重复的已经完成的工作。第一部分可以通过代码重构完成,第二部分不做重复的...

老韭菜
今天
0
0
缓存穿透、并发和雪崩那些事

0 题记 缓存穿透、缓存并发和缓存雪崩是常见的由于并发量大而导致的缓存问题,本文讲解其产生原因和解决方案。 缓存穿透通常是由恶意攻击或者无意造成的;缓存并发是由设计不足造成的;缓存雪...

Java填坑之路
今天
1
0
项目jar包管理构建工具---Maven

一、what is Maven? 我们来寻找一下官网,里面介绍了maven到底是什么?下面一句话就有讲解到:Apache Maven is a software project management and comprehension tool. Based on the conc...

一看就喷亏的小猿
今天
0
0

没有更多内容

加载失败,请刷新页面

加载更多

下一页

返回顶部
顶部