2024级计算机应用技术(人工智能)专业

数据采集与预处理
期末复习题库

沧州幼儿师范高等专科学校 · 第四学期 · 2025—2026学年

50
选择题
50
判断题
100
题目合计
📝
单项选择题
每题只有一个正确答案 · 共50题
01
关于网络爬虫的描述,以下哪项是正确的?
A爬虫只能爬取静态网页
B爬虫是一种自动抓取互联网信息的程序
C爬虫不需要遵守任何法律规范
D爬虫只能用于商业目的
02
以下哪个HTTP方法用于提交表单数据,不会将参数暴露在URL中?
AGET
BPOST
CHEAD
DOPTIONS
03
Robots协议的主要作用是?
A提高网页爬取速度
B规定爬虫程序允许或禁止访问的页面范围
C加密网站数据
D过滤垃圾邮件
04
在Python中,以下哪种数据类型是不可变的?
Alist(列表)
Bdict(字典)
Ctuple(元组)
Dset(集合)
05
"聚焦爬虫"的特点是?
A无限制地爬取所有网页
B只爬取与特定主题相关的网页
C专门爬取图片资源
D只能在局域网中使用
06
HTTP请求报文由哪几部分组成?
A请求行、请求头、空行、请求体
B状态行、响应头、空行、响应体
CURL、方法、版本、数据
D协议、域名、路径、参数
07
以下哪项不属于常用的爬虫工具?
AScrapy
BSelenium
CMySQL
DRequests
08
Python代码 x=[1,2,3]; print(x[1]) 的输出结果是?
A1
B2
C3
D报错
09
HTTP状态码 404 表示?
A请求成功
B服务器内部错误
C资源未找到
D请求被重定向
10
Python中用于定义类的关键字是?
Adef
Bclass
Cobject
Dstruct
11
关于Python函数,以下说法错误的是?
A函数用def关键字定义
B函数可以有默认参数
C一个函数只能有一个return语句
D函数可以返回多个值
12
Python的Requests库发送POST请求时,传递JSON数据的参数是?
Aparams=
Bdata=
Cjson=
Dbody=
13
在Python中,try...except结构的用途是?
A定义循环
B异常处理
C定义函数
D导入模块
14
使用Requests库获取网页响应后,获取响应状态码的属性是?
Aresponse.text
Bresponse.status_code
Cresponse.code
Dresponse.content
15
BeautifulSoup库中,查找第一个匹配元素的方法是?
Afind_all()
Bselect()
Cfind()
Dget()
16
XPath表达式 //div[@class="title"] 的含义是?
A查找第一个div标签
B查找所有class属性为title的div标签
C查找title标签下的div标签
D查找id为title的div标签
17
正则表达式中,\d+ 的含义是?
A匹配一个或多个数字
B匹配零个或多个数字
C匹配一个数字
D匹配任意字符
18
lxml库中,通常使用哪个对象解析HTML并支持XPath查询?
ABeautifulSoup
Betree
Cjson
Dre
19
Python中使用正则表达式需要导入哪个模块?
Aregex
Bre
Cpattern
Dmatch
20
BeautifulSoup中 soup.find_all('a') 的返回结果类型是?
A字符串
B字典
C列表
D元组
21
XPath中,@href 的作用是?
A选取所有标签名为href的元素
B选取元素的href属性值
C创建一个href属性
D删除href属性
22
使用CSS选择器选择class为content的p标签,正确写法是?
Asoup.select('p#content')
Bsoup.select('p.content')
Csoup.select('p[content]')
Dsoup.select('content.p')
23
BeautifulSoup解析HTML时,使用 soup.get_text() 的作用是?
A获取页面中所有超链接
B提取页面所有纯文本内容
C返回HTML源码字符串
D获取页面标题
24
使用BeautifulSoup获取标签属性值的正确方式是(以获取 <a> 标签的href为例)?
Atag.href
Btag['href']
Ctag.get_attr('href')
Dtag.attribute('href')
25
以下哪种解析器解析HTML时速度最快?
Ahtml.parser
Bhtml5lib
Clxml
D三者速度相同
26
CSS选择器中,选取id为 main 的元素写法是?
A.main
B#main
Cmain
D*main
27
Python re.findall(pattern, string) 的返回值类型是?
A字符串
B列表
C生成器
D元组
28
使用Python将数据存储为CSV文件,通常使用哪个库?
Aos
Bcsv
Cjson
Dsys
29
PyMySQL连接MySQL数据库时,以下哪个参数是必须指定的?
A字符集
B端口号
C主机(host)、用户名、密码
D超时时间
30
执行MySQL插入操作后,必须调用哪个方法才能使数据真正写入数据库?
Acursor.execute()
Bconnection.commit()
Ccursor.close()
Dconnection.ping()
31
将爬取的数据存储为Excel(.xlsx)文件,可以使用哪个Python库?
Acsv
Bsqlite3
Copenpyxl
Djson
32
Python中 json.dumps(data) 的作用是?
A将JSON字符串解析为Python对象
B将Python对象序列化为JSON格式字符串
C将数据写入JSON文件
D从JSON文件中读取数据
33
MongoDB是哪种类型的数据库?
A关系型数据库
B文档型NoSQL数据库
C列式数据库
D图数据库
34
Selenium与Requests相比,最主要的优势是?
A爬取速度更快
B能执行JavaScript、模拟真实浏览器行为
C代码更简单
D不需要安装驱动
35
使用Selenium时,WebDriverWait配合expected_conditions的主要作用是?
A关闭浏览器窗口
B等待页面元素加载完成再进行操作
C截图保存页面
D切换浏览器标签页
36
Scrapy框架的核心组件中,负责发送请求并接收响应的是?
ASpider(爬虫)
BDownloader(下载器)
CPipeline(管道)
DScheduler(调度器)
37
Scrapy中,创建一个名为 demo 的新项目的命令是?
Ascrapy new demo
Bscrapy create demo
Cscrapy startproject demo
Dscrapy init demo
38
Scrapy爬虫运行时,将结果保存到result.csv的命令是?
Ascrapy run hello -o result.csv
Bscrapy crawl hello -o result.csv
Cscrapy start hello --save result.csv
Dscrapy execute hello > result.csv
39
反爬虫机制中,网站通过检查哪个HTTP请求头来识别爬虫身份?
AContent-Type
BUser-Agent
CAccept
DHost
40
以下哪种方式属于常见的反爬虫手段?
AIP封禁
B验证码
C检测User-Agent
D使用HTTPS协议
41
数据预处理的主要步骤不包括以下哪项?
A数据清洗
B数据集成
C数据可视化
D数据变换
42
Pandas中,删除含有缺失值(NaN)的行的方法是?
Adf.drop_na()
Bdf.dropna()
Cdf.remove_nan()
Ddf.fillna(0)
43
使用Pandas读取CSV文件的函数是?
Apd.read_excel()
Bpd.load_csv()
Cpd.read_csv()
Dpd.open_csv()
44
数据清洗中,处理重复数据的Pandas方法是?
Adf.remove_duplicates()
Bdf.drop_duplicates()
Cdf.clean_duplicates()
Ddf.unique()
45
数据标准化(Normalization)的目的是?
A将数据转换为固定的字符串格式
B将数据缩放到统一范围(如0到1),消除量纲影响
C删除数据中的空值
D对数据进行加密处理
46
在Python中,str.strip() 方法的作用是?
A将字符串全部转为大写
B去除字符串两端的空白字符
C分割字符串
D替换字符串中的内容
47
Pandas中,用指定值填充缺失值(NaN)的方法是?
Adf.dropna()
Bdf.fillna(value)
Cdf.replace()
Ddf.insert()
48
以下哪个选项正确描述了"爬虫的工作原理"?
A直接读取服务器本地文件
B发送HTTP请求 → 获取响应 → 解析内容 → 提取数据 → 存储
C通过数据库接口直接查询网站数据库
D截取网络数据包获取数据
49
Python字符串方法 str.split(',') 的作用是?
A将字符串按逗号拆分,返回列表
B将列表按逗号合并为字符串
C在字符串中插入逗号
D删除字符串中的逗号
50
下列关于Python with open() 语句的描述,正确的是?
A只能用于读取文件,不能写入
Bwith语句会在代码块结束后自动关闭文件
C必须手动调用close()方法关闭文件
D只能打开文本文件,不能打开二进制文件
判断题
正确写"√",错误写"×" · 共50题
01
网络爬虫可以无限制地爬取任何网站的任何内容,不需要考虑法律问题。
02
HTTP协议中,GET请求和POST请求都可以携带请求体(Body)传递数据。
03
Robots协议是一种强制性的技术限制,爬虫程序在技术上无法绕过它。
04
HTTP状态码200表示请求成功,服务器正常返回了数据。
05
大数据的采集方式包括网络爬虫、API接口、日志采集等多种方式。
06
使用Requests库发送请求时,可以通过headers参数设置自定义请求头,如User-Agent。
07
聚焦爬虫会沿着所有链接无限制地抓取整个互联网的页面。
08
Python中列表(list)和元组(tuple)都支持通过索引访问元素。
09
Python的re.match()方法只从字符串的开头开始匹配,而re.search()在整个字符串中搜索。
10
Python是一种强类型、静态类型的编程语言。
11
在Python中,字典(dict)的键(key)必须是不可变类型。
12
BeautifulSoup中,find_all()若没有找到任何匹配元素,会抛出异常而不是返回空列表。
13
Python中一个函数可以同时返回多个值,本质上是以元组形式返回的。
14
XPath表达式 //a/@href 可以提取页面中所有超链接的href属性值。
15
Python的for循环只能遍历列表,不能遍历字典或字符串。
16
面向对象编程中,子类可以继承父类的方法和属性。
17
Scrapy框架中,Item Pipeline主要用于对爬取到的数据进行处理(清洗、验证、存储等)。
18
BeautifulSoup的find()方法会返回所有匹配的标签列表。
19
Scrapy爬虫必须继承scrapy.Spider类,并实现parse()方法。
20
XPath中,// 表示从文档任意位置开始匹配,/ 表示从根节点开始匹配。
21
Scrapy框架的settings.py文件可以配置爬虫的下载延迟(DOWNLOAD_DELAY)来避免频繁请求。
22
使用BeautifulSoup解析网页时,只能使用Python内置的html.parser解析器,不能使用lxml。
23
Python中,list.append()list.extend()的效果完全相同,都是向列表末尾添加元素。
24
CSS选择器中,.title 表示选择class为title的元素,#title 表示选择id为title的元素。
25
Python中,使用open('file.txt', 'w')打开文件会清空原有内容后写入,而'a'模式是追加写入。
26
lxml库的XPath解析速度通常比Python内置的html.parser更快。
27
Pandas的DataFrame是一种二维表格型数据结构,每列可以是不同的数据类型。
28
使用PyMySQL执行INSERT语句后,即使不调用commit(),数据也会自动永久保存到数据库中。
29
数据清洗的目的是消除数据中的噪声、重复、缺失和不一致,使数据质量更高。
30
将爬取的数据存储为Excel文件(.xlsx),可以使用Python的openpyxl或pandas库来实现。
31
Python中,字典的keys()方法返回的是一个普通列表(list)类型。
32
CSV文件本质上是一种以逗号分隔字段的纯文本文件,可以用任意文本编辑器打开。
33
爬虫设置代理IP的主要目的是绕过目标网站的IP封禁反爬措施。
34
Python中,isinstance(x, int)可以判断变量x是否为整数类型。
35
Selenium在使用Chrome浏览器时,必须下载与浏览器版本匹配的ChromeDriver才能正常驱动浏览器。
36
HTML中,所有的标签都必须成对出现(有开始标签就必须有结束标签),没有自闭合标签。
37
Selenium中,driver.quit()会关闭所有浏览器窗口并退出驱动进程,而driver.close()只关闭当前窗口。
38
在爬虫开发中,设置合理的请求间隔(延迟)是一种遵守网站规则、避免对服务器造成压力的良好实践。
39
动态网页的内容全部都包含在HTML源代码中,因此使用Requests直接请求URL就能获取所有数据。
40
Python中,None0、空字符串""、空列表[]在布尔判断中均为False
41
JSON格式中,对象(object)用花括号{}表示,数组(array)用方括号[]表示。
42
使用response.encoding = 'utf-8'可以解决Requests获取网页时出现乱码的问题。
43
Python中,range(5)生成的序列包含数字0到5,共6个数。
44
数据采集中,API接口方式比网络爬虫方式更稳定、更合法,获取的数据也更结构化。
45
Scrapy中,start_urls列表定义了爬虫的初始爬取地址,框架会自动对这些URL发起请求。
46
Python的f-string(如f"Hello {name}")是一种格式化字符串的方法,仅在Python 3.6及以上版本中可用。
47
爬虫程序只要速度够快、技术合法,就可以不用考虑网站的服务条款(Terms of Service)。
48
BeautifulSoup中,soup.title.string可以直接获取网页<title>标签的文本内容。
49
Python中,import requests语句需要先通过pip install requests安装该第三方库。
50
网络爬虫爬取公开信息属于完全合法行为,不需要考虑任何法律风险。