diff --git a/README.md b/README.md index 08b32b7d..0e06c08b 100644 --- a/README.md +++ b/README.md @@ -1,18 +1,20 @@ -### 这是我日常遇到的一些小问题的解决办法,全部是基于Python3 +### 此爬虫项目forked from injetlee,自己在学习的时候也做了一些修复或者修改。在Python 3.0及2.7下可运行 -1.[获取当前CPU状态,存储到Influxdb](https://github.com/injetlee/demo/blob/master/CpuToInfluxdb.py) +1.[获取当前CPU状态,存储到Influxdb](https://github.com/Kylelkh/Python-2/blob/master/CpuToInfluxdb.py) -2.[模拟登录知乎](https://github.com/injetlee/demo/blob/master/login_zhihu.py) +2.[模拟登录知乎](https://github.com/Kylelkh/Python-2/blob/master/login_zhihu.py) -3.[对目录下所有文件计数](https://github.com/injetlee/demo/blob/master/countFile.py) +3.[对目录下所有文件计数](https://github.com/Kylelkh/Python-2/blob/master/countFile.py) -4.[爬取豆瓣电影top250](https://github.com/injetlee/demo/blob/master/douban_movie.py) +4.[爬取豆瓣电影top250](https://github.com/Kylelkh/Python-2/blob/master/douban_movie.py) -5.[Excel文件读入数据库](https://github.com/injetlee/demo/blob/master/excelToDatabase.py) +5.[Excel文件读入数据库](https://github.com/Kylelkh/Python-2/blob/master/excelToDatabase.py) -6.[爬取拉勾网职位信息](https://github.com/injetlee/demo/blob/master/lagouSpider.py) +6.[爬取拉勾网职位信息](https://github.com/Kylelkh/Python-2/blob/master/lagouSpider.py) -7.[批量修改文件名](https://github.com/injetlee/demo/blob/master/ModifyFilename.py) +7.[批量修改文件名](https://github.com/Kylelkh/Python-2/blob/master/ModifyFilename.py) -8.[读写excel](https://github.com/injetlee/demo/blob/master/readExcel.py) +8.[读写excel](https://github.com/Kylelkh/Python-2/blob/master/readExcel.py) + +另外,如果使用上有问题,可以查看wiki文档,我会根据自己遇到的问题并且将注意事项在wiki中说明。在此特别感谢injetlee。 diff --git a/lagouSpider.py b/lagouSpider.py index 8432ce66..f5f007dc 100644 --- a/lagouSpider.py +++ b/lagouSpider.py @@ -1,3 +1,5 @@ +#-*- coding:utf-8 -*- +#正常爬取拉勾数据,由于编码问题,可能出现字符显示乱码。 import requests from openpyxl import Workbook @@ -9,7 +11,7 @@ def get_json(url, page, lang_name): for i in list_con: info = [] info.append(i['companyShortName']) - info.append(i['companyName']) + #info.append(i['companyName']) info.append(i['salary']) info.append(i['city']) info.append(i['education']) @@ -18,7 +20,7 @@ def get_json(url, page, lang_name): def main(): - lang_name = input('职位名:') + lang_name = raw_input("Press the enter the job name:") page = 1 url = 'http://www.lagou.com/jobs/positionAjax.json?needAddtionalResult=false' info_result = [] @@ -31,7 +33,8 @@ def main(): ws1.title = lang_name for row in info_result: ws1.append(row) - wb.save('职位信息.xlsx') + filename = "job_info_about_"+lang_name+".xlsx" + wb.save(filename) if __name__ == '__main__': main()