怎么用Python电商车厘子销售数据
发表于:2024-11-23 作者:千家信息网编辑
千家信息网最后更新 2024年11月23日,这篇文章主要讲解了"怎么用Python电商车厘子销售数据",文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习"怎么用Python电商车厘子销售数据"吧!01
千家信息网最后更新 2024年11月23日怎么用Python电商车厘子销售数据
这篇文章主要讲解了"怎么用Python电商车厘子销售数据",文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习"怎么用Python电商车厘子销售数据"吧!
01 数据获取
本文利用Python采集了淘宝网1585个商家车厘子销售数据,获取到车厘子的商品名称、商品价格、付款人数、店铺名称、发货地址等字段。限于篇幅,爬虫代码仅给出主函数:
def main:browser.get('https://www.taobao.com/')page = search_product(key_word)print(page)get_datapage_num = 70while int(page) != page_num:print("-" * 100)print("正在爬取第{}页数据".format(page_num + 1))browser.get('https://s.taobao.com/search?q={}&s={}'.format(key_word, page_num*44))browser.implicitly_wait(10)get_datapage_num += 1print("数据抓取完成")if __name__ == '__main__':key_word = "车厘子"browser = webdriver.Chrome("./chromedriver")main
02 数据处理
1.数据读取并预览
import pandas as pdimport numpy as npdf = pd.read_csv('/菜J学Python/淘宝/车厘子.csv',header=None,names=['商品名称','商品价格','付款人数','店铺名称','发货地址']) #添加字段名称df.sample(5)
2.查看数据信息
df.info
Int64Index: 1595 entries, 0 to 1674Data columns (total 5 columns):# Column Non- Count Dtype--- ------ -------------- -----0 商品名称 1595 non- object1 商品价格 1595 non- float642 付款人数 1595 non- object3 店铺名称 1595 non- object4 发货地址 1585 non- objectdtypes: float64(1), object(4)memory usage: 74.8+ KB
发现数据存在以下几个问题:
(1)发货地址有缺失值
(2)付款人数需做提取
(3)发货地址需做分割
(4)自定义索引并降序
3.数据清洗
#剔除缺失记录df.dropna(axis=0, how='any', inplace=True)#从发货地址字段中切分出省份和城市df["省份"] = df["发货地址"].str.split(' ',expand=True)[0] #expand=True可以把用分割的内容直接分列df["城市"] = df["发货地址"].str.split(' ',expand=True)[1] #提取城市df["城市"].fillna(df["省份"], inplace=True) #城市字段空值用省份非空值填充#用正则表达式从付款人数中提取数字import redf['数字'] = [re.findall(r'(\d+\.{0,1}\d*)', i)[0] for i in df['付款人数']] # 提取数值df['数字'] = df['数字'].astype('float') # 转化数值型df['单位'] = [''.join(re.findall(r'(万)', i)) for i in df['付款人数']] # 提取单位(万)df['单位'] = df['单位'].apply(lambda x:10000 if x=='万' else 1)df['付款人数'] = df['数字'] * df['单位'] # 计算付款人数df.drop(['发货地址', '数字', '单位'], axis=1, inplace=True) # 删除多余的列#按商品价格降序并重置索引df = df.sort_values(by="商品价格", axis=0, ascending=False) #降序df = df.reset_index(drop=True) #重置索引
清洗后,数据预览如下:
感谢各位的阅读,以上就是"怎么用Python电商车厘子销售数据"的内容了,经过本文的学习后,相信大家对怎么用Python电商车厘子销售数据这一问题有了更深刻的体会,具体使用情况还需要大家实践验证。这里是,小编将为大家推送更多相关知识点的文章,欢迎关注!
数据
人数
地址
商品
名称
单位
数字
销售
价格
商品价格
城市
电商
字段
省份
内容
店铺
索引
学习
数值
缺失
数据库的安全要保护哪些东西
数据库安全各自的含义是什么
生产安全数据库录入
数据库的安全性及管理
数据库安全策略包含哪些
海淀数据库安全审计系统
建立农村房屋安全信息数据库
易用的数据库客户端支持安全管理
连接数据库失败ssl安全错误
数据库的锁怎样保障安全
公司的经营范围有软件开发
广东网络安全110中心
青少年网络安全知识答题环节
数据库管理系统是不是一组硬件
多网口服务器
17年最强amd服务器处理器
信息技术创建数据库
广州电脑软件开发价格表
网络技术学习三大技巧
为什么象棋无法连接服务器
数据库加解密函数
中国技术与软件开发公司
本地数据库一运行就停止工作
大型数据库系统基于什么
互联网科技股市
通用数据库连接工具
一汽奔腾软件开发岗工资
网络安全毕业标题
林毅夫视频软件开发
后端除了数据库
关于软件开发企业管理的论文
如何搭建一台文件共享服务器
数据库主键怎么设置
贵州交警app数据库异常
软件开发用户关系树
数据库管理员的技术要求
网络安全信息产业园双流
锋云服务器评分功能不见了
社区疫情防控数据库
我的世界国战服务器招人