安装lxml

首先需要pip install lxml安装lxml库。
如果你在ubuntu上遇到了以下错误:
#include "libxml/xmlversion.h"
compilation terminated.
error: command 'x86_64-linux-gnu-gcc' failed with exit status 1
----------------------------------------
Cleaning up...
Removing temporary dir /tmp/pip_build_root...
Command /usr/bin/python -c "import setuptools, tokenize;__file__='/tmp/pip_build_root/lxml/setup.py';exec(compile(getattr(tokenize, 'open', open)(__file__).read().replace('\r\n', '\n'), __file__, 'exec'))" install --record /tmp/pip-O4cIn6-record/install-record.txt --single-version-externally-managed --compile failed with error code 1 in /tmp/pip_build_root/lxml
Exception information:
Traceback (most recent call last):
File "/usr/lib/python2.7/dist-packages/pip/basecommand.py", line 122, in main
status = self.run(options, args)
File "/usr/lib/python2.7/dist-packages/pip/commands/install.py", line 283, in run
requirement_set.install(install_options, global_options, root=options.root_path)
File "/usr/lib/python2.7/dist-packages/pip/req.py", line 1435, in install
requirement.install(install_options, global_options, *args, **kwargs)
File "/usr/lib/python2.7/dist-packages/pip/req.py", line 706, in install
cwd=self.source_dir, filter_stdout=self._filter_install, show_stdout=False)
File "/usr/lib/python2.7/dist-packages/pip/util.py", line 697, in call_subprocess
% (command_desc, proc.returncode, cwd))
InstallationError: Command /usr/bin/python -c "import setuptools, tokenize;__file__='/tmp/pip_build_root/lxml/setup.py';exec(compile(getattr(tokenize, 'open', open)(__file__).read().replace('\r\n', '\n'), __file__, 'exec'))" install --record /tmp/pip-O4cIn6-record/install-record.txt --single-version-externally-managed --compile failed with error code 1 in /tmp/pip_build_root/lxml
请安装以下依赖:
sudo apt-get install libxml2-dev libxslt1-dev
Python代码
下面是生成sitemap和sitemapindex索引的代码,可以按照需求传入需要的参数,或者增加字段:
#!/usr/bin/env python
# -*- coding:utf-8 -*-
import io
import re
from lxml import etree
def generate_xml(filename, url_list):
"""Generate a new xml file use url_list"""
root = etree.Element('urlset',
xmlns="http://www.sitemaps.org/schemas/sitemap/0.9")
for each in url_list:
url = etree.Element('url')
loc = etree.Element('loc')
loc.text = each
url.append(loc)
root.append(url)
header = u'<?xml version="1.0" encoding="UTF-8"?>\n'
s = etree.tostring(root, encoding='utf-8', pretty_print=True)
with io.open(filename, 'w', encoding='utf-8') as f:
f.write(unicode(header+s))
def update_xml(filename, url_list):
"""Add new url_list to origin xml file."""
f = open(filename, 'r')
lines = [i.strip() for i in f.readlines()]
f.close()
old_url_list = []
for each_line in lines:
d = re.findall('<loc>(http:\/\/.+)<\/loc>', each_line)
old_url_list += d
url_list += old_url_list
generate_xml(filename, url_list)
def generatr_xml_index(filename, sitemap_list, lastmod_list):
"""Generate sitemap index xml file."""
root = etree.Element('sitemapindex',
xmlns="http://www.sitemaps.org/schemas/sitemap/0.9")
for each_sitemap, each_lastmod in zip(sitemap_list, lastmod_list):
sitemap = etree.Element('sitemap')
loc = etree.Element('loc')
loc.text = each_sitemap
lastmod = etree.Element('lastmod')
lastmod.text = each_lastmod
sitemap.append(loc)
sitemap.append(lastmod)
root.append(sitemap)
header = u'<?xml version="1.0" encoding="UTF-8"?>\n'
s = etree.tostring(root, encoding='utf-8', pretty_print=True)
with io.open(filename, 'w', encoding='utf-8') as f:
f.write(unicode(header+s))
if __name__ == '__main__':
urls = ['http://www.baidu.com'] * 10
mods = ['2004-10-01T18:23:17+00:00'] * 10
generatr_xml_index('index.xml', urls, mods)
效果
生成的效果应该是这种格式:
sitemap格式:
<?xml version="1.0" encoding="UTF-8"?> <urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <url> <loc>http://www.example.com/foo.html</loc> </url> </urlset>
sitemapindex格式:
<?xml version="1.0" encoding="UTF-8"?> <sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9"> <sitemap> <loc>http://www.example.com/sitemap1.xml.gz</loc> <lastmod>2004-10-01T18:23:17+00:00</lastmod> </sitemap> <sitemap> <loc>http://www.example.com/sitemap2.xml.gz</loc> <lastmod>2005-01-01</lastmod> </sitemap> </sitemapindex>
lastmod时间格式的问题
格式是用ISO 8601的标准,如果是linux/unix系统,可以使用以下函数获取
def get_lastmod_time(filename):
time_stamp = os.path.getmtime(filename)
t = time.localtime(time_stamp)
# return time.strftime('%Y-%m-%dT%H:%M:%S+08:00', t)
return time.strftime('%Y-%m-%dT%H:%M:%SZ', t)
优化
一般来说,用lxml效率低并且内存占用比较大,可以直接用文件的write方法创建。
def generate_xml(filename, url_list):
with gzip.open(filename,"w") as f:
f.write("""<?xml version="1.0" encoding="utf-8"?>
<urlset xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">\n""")
for i in url_list:
f.write("""<url><loc>%s</loc></url>\n"""%i)
f.write("""</urlset>""")
def append_xml(filename, url_list):
with gzip.open(filename, 'r') as f:
for each_line in f:
d = re.findall('<loc>(http:\/\/.+)<\/loc>', each_line)
url_list.extend(d)
generate_xml(filename, set(url_list))
def modify_time(filename):
time_stamp = os.path.getmtime(filename)
t = time.localtime(time_stamp)
return time.strftime('%Y-%m-%dT%H:%M:%S:%SZ', t)
def new_xml(filename, url_list):
generate_xml(filename, url_list)
root = dirname(filename)
with open(join(dirname(root), "sitemap.xml"),"w") as f:
f.write('<?xml version="1.0" encoding="utf-8"?>\n<sitemapindex xmlns="http://www.sitemaps.org/schemas/sitemap/0.9">\n')
for i in glob.glob(join(root,"*.xml.gz")):
lastmod = modify_time(i)
i = i[len(CONFIG.SITEMAP_PATH):]
f.write("<sitemap>\n<loc>http:/%s</loc>\n"%i)
f.write("<lastmod>%s</lastmod>\n</sitemap>\n"%lastmod)
f.write('</sitemapindex>')
总结
以上就是这篇文章的全部内容了,希望本文的内容对大家学习或者使用python能带来一定的帮助,如果有疑问大家可以留言交流。谢谢大家对的支持。
# python生成xml文件
# python
# xml生成
# python脚本实例
# python生成xml时规定dtd实例方法
# Python根据指定文件生成XML的方法
# Python如何生成xml文件
# 利用 Python ElementTree 生成 xml的实例
# python 批量修改 labelImg 生成的xml文件的方法
# 对python 生成拼接xml报文的示例详解
# 使用Python生成XML的方法实例
# Python中使用dom模块生成XML文件示例
# python网络编程学习笔记(八):XML生成与解析(DOM、ElementTree)
# python将xml xsl文件生成html文件存储示例讲解
# python 生成xml文件
# 以及美化的实例代码
# 你在
# 可以直接
# 可以使用
# 这篇文章
# 比较大
# 谢谢大家
# 应该是
# 有疑问
# options
# main
# run
# line
# requirement_set
# install_options
# global_options
# args
# commands
# Exception
# information
# Traceback
相关文章:
如何实现建站之星域名转发设置?
如何优化Golang Web性能_Golang HTTP服务器性能提升方法
香港服务器租用费用高吗?如何避免常见误区?
山东网站制作公司有哪些,山东大源集团官网?
武汉网站如何制作,黄黄高铁武穴北站途经哪些村庄?
ui设计制作网站有哪些,手机UI设计网址吗?
高端云建站费用究竟需要多少预算?
建站VPS选购需注意哪些关键参数?
深圳网站制作平台,深圳市做网站好的公司有哪些?
建站之星备案是否影响网站上线时间?
网站制作大概多少钱一个,做一个平台网站大概多少钱?
如何快速搭建高效香港服务器网站?
怎么将XML数据可视化 D3.js加载XML
如何通过PHP快速构建高效问答网站功能?
定制建站价位费用解析与套餐推荐全攻略
一键网站制作软件,义乌购一件代发流程?
如何通过.red域名打造高辨识度品牌网站?
如何在建站主机中优化服务器配置?
网站按钮制作软件,如何实现网页中按钮的自动点击?
赚钱网站制作软件,建一个网站怎样才能赚钱?是如何盈利的?
如何在Golang中实现微服务服务拆分_Golang微服务拆分与接口管理方法
宝塔新建站点为何无法访问?如何排查?
,怎么在广州志愿者网站注册?
如何在IIS7中新建站点?详细步骤解析
宝塔新建站点报错如何解决?
公司网站的制作公司,企业网站制作基本流程有哪些?
建站10G流量真的够用吗?如何应对访问高峰?
三星网站视频制作教程下载,三星w23网页如何全屏?
免费制作小说封面的网站有哪些,怎么接网站批量的封面单?
网站专业制作公司,网站编辑是做什么的?好做吗?工作前景如何?
代刷网站制作软件,别人代刷火车票靠谱吗?
,有什么在线背英语单词效率比较高的网站?
如何用手机制作网站和网页,手机移动端的网站能制作成中英双语的吗?
电影网站制作价格表,那些提供免费电影的网站,他们是怎么盈利的?
制作电商网页,电商供应链怎么做?
学校免费自助建站系统:智能生成+拖拽设计+多端适配
制作网站怎么制作,*游戏网站怎么搭建?
建站org新手必看:2024最新搭建流程与模板选择技巧
如何在Ubuntu系统下快速搭建WordPress个人网站?
建站主机选购指南与交易推荐:核心配置解析
制作证书网站有哪些,全国城建培训中心证书查询官网?
南宁网站建设制作定制,南宁网站建设可以定制吗?
北京制作网站的公司,北京铁路集团官方网站?
XML的“混合内容”是什么 怎么用DTD或XSD定义
文字头像制作网站推荐软件,醒图能自动配文字吗?
如何解决VPS建站LNMP环境配置常见问题?
如何通过虚拟主机快速搭建个人网站?
制作农业网站的软件,比较好的农业网站推荐一下?
高端网站建设与定制开发一站式解决方案 中企动力
如何用花生壳三步快速搭建专属网站?
*请认真填写需求信息,我们会在24小时内与您取得联系。