当前位置：文档之家› 基于JSP的网络百宝箱的设计与实现

基于JSP的网络百宝箱的设计与实现

学号：1010411071

本科毕业论文（设计）

(2014届)

基于JSP的网络百宝箱的设计与实现院系计算机科学与技术系

专业计算机科学与技术

姓名朱苏婷

指导教师史君华

职称副教授

基于JSP的网络百宝箱的设计与实现

摘要

网络百宝箱系统旨在为注册用户提供一系列方便、快捷的网络工具，使得用户对信息的存取变得简单，可以及时地储存重要的通讯录，对生活琐事进行记录，收藏常用的网站以及备份重要的文件。本次毕业设计通过先进的开发平台与工具，实现了一个具有开放体系结构的、易扩充与维护的、具有良好人机交互界面的网络百宝箱系统。

系统采用MyEclipse作为开发工具，SQL Server 2005作为开发平台，实现了用户对个人信息、通讯录、记事本、重要文件以及网络资源的管理。论文首先介绍了系统的开发背景及意义、开发工具和技术，其次进行可行性研究和需求分析，然后是系统设计及测试，最后总结全文。

关键词：网络百宝箱JSP

ABSTRACT

The network treasure box system is aimed at providing the registration user a series of convenient and quick network tool, so that the user can be simple to deposit the information, store up the important address book timely, carry on the record to the life trivial matters, collect the commonly used website and backup important document. This graduation project realizes a network treasure chest system by the advanced development platform and the tool , which has the opening architecture and good man-machine interaction contact surface, it can be easy to be expanded and the maintained.

The system uses MyEclipse as the development kit, SQL Server 2005 as the development platform, has realized individual information, the address book, the memorandum, the important document as well as the network resources management. The thesis first introduces the system development background and the significance, the development kit and the technology, next carries on the feasibility analysis and the demand analysis, then introduces the system design and test, finally summarizes the total text.

Keywords: Network The treasure box JSP

第1章绪论 (1)

1.1 课题开发背景及意义 (1)

1.2 开发环境与相关技术介绍 (1)

1.3 论文组织结构 (4)

第2章可行性研究和需求分析 (4)

2.1 可行性研究 (4)

2.2 需求分析 (4)

第3章系统总体设计 (5)

3.1 系统功能描述 (5)

3.2 系统功能框架示意图 (6)

3.3 数据库设计 (9)

第4章详细设计与实现 (16)

4.1 用户注册与登录管理 (16)

4.2 通讯录管理 (19)

4.3 记事本管理 (21)

4.4 收藏夹管理 (23)

4.5 储物箱管理 (24)

4.6 个人信息管理 (27)

4.7 用户管理 (29)

第5章系统的测试 (30)

5.1 测试的目的及意义 (30)

5.2 测试内容及结果 (30)

第6章结束语 (33)

6.1 本文总结 (33)

6.2 工作展望 (33)

致谢 (34)

参考文献 (35)

附录 (36)

第1章绪论

1.1 课题开发背景及意义

1.1.1 课题开发背景

随着社会的进步，信息技术的发展，人们的生活也发生了很大的不同。传统的信息储存和读取方式已满足不了人们的需求，这时网络应用的普及，给人们带来了便利。网络跟人们日常生活的联系越来越紧密，人们使用网络的频率也越来越高，人们越来越喜欢通过网络来获取自己想要的资源。但是随着网络的不断进步，人们的需求也在不断的提高，用户存储信息、读取信息遇到了一系列的问题，物理存储设备的携带便捷性以及容量大小等问题越发不能满足用户方便快捷的需求。人们想要随时随地从网络获得资源的同时，也迫切地需要能够在网上保存一些个人的重要文件和信息，并收藏自己喜欢的网络资源，这时网络百宝箱的开发显得尤为重要[1]。

1.1.2课题开发目的及意义

本次毕业设计的主要目的是设计与实现一个网络百宝箱系统，提供一个在线的个人信息管理的平台，实现用户对通讯录、重要文件以及网络资源的管理。网络百宝箱系统不仅可以为广大用户记录生活琐事、管理通讯录、收藏喜欢的网站等带来方便，也可为用户提供文件的上传以及下载功能，用户再也不需要出门总是带着一个U盘，也不用担心U盘不够大，只要有网络，用户可以随时随地直接将文件上传到自己的储物箱中去，日后若需要，直接从储物箱下载即可。网络百宝箱系统是根据用户信息资源存取方便的趋势所形成的，是用户管理个人信息必需的，它不仅满足了广大用户的要求，也体现了网络资源方便快捷的理念，是在当前经济发展、个人需求等形式下产生的，构建网络百宝箱系统是当前网络与计算机技术不断发展的必然结果。

1.2 开发环境与相关技术介绍

本系统采用面向对象的软件开发方法，以MyEclipse作为前台开发工具，以SQL Server 2005作为后台数据库，服务器则使用Tomcat。通过结合Java语言的完全面向对象，JSP 语言的简单方便以及SQL强大的查询语言较好的实现了预定的需求功能。

1.2.1 开发环境

项目中系统开发时的环境配置[2]如下：

开发环境：JDK1.7、SQL Server 2005；

开发工具：MyEclipse 10.0、TomCat 7.0；

操作系统：Windows2000或Windows XP或Windows Vista或win7视窗操作系统。1.2.2 MyEclipse

MyEclipse 支持JSP，JDBC，Java，Servlet等多种工具，应用十分广泛，功能非常强大。它是Eclipse的插件集合，用于Java，J2EE的开发，支持代码的编写、配置、测试以及排错[3]。相比于Eclipse，在数据库和Java开发等方面，使用MyEclipse可以提高工作效率，受到广大开发人员的支持。

图1-1 Myeclipse主界面

1.2.3 Microsoft SQL Server 2005

Microsoft SQL Server 2005 是一个全面的数据库平台[4]，与前一版本相比，数据库镜像在线恢复、快速恢复让SQL 服务器的可用性有了大的提升。另外，SQL Server 2005 在安全性能上做了一些改进，如数据库加密、密码政策的增强，设置安全默认值等。软件主界面如图1-2所示。

图1-2 Microsoft SQL Server 2005主界面

1.2.4 JA V A

Java语言起始于1995年，是SUN公司推出的一种面向对象程序。目前，Java已成为一种主流，其应用领域不断在扩大，主要特点如下[5]：

第一，面向对象。它在面向对象特性上相对于C++更加彻底，容易扩充与维护。Java 中的类机制和动态接口模型，让复杂系统的设计变得更加简单。

第二，平台无关性。用Java语言写的程序可以跨越不同的平台，不用修改。

第三，可靠性和安全性。Java主要开发网络应用程序，因此对安全性要求较高。在执行Java程序时，程序的安全性受到Java虚拟机的检测。为了防止病毒程序的产生以及下载程序对本地系统的威胁，Java创造了自己的安全机制，提高了安全性。在编译Java程序时，Java字节码首先需接受字节码校验器的检查，接着Java解释器将决定程序中类的内存布局，然后为避免应用程序之间相互干扰破坏，类装载器负责把来自网络的类装载到单独的内存区域，使得Java成为安全的编程语言。

第四，多线程性。主要用来处理复杂事务或需要并行的事务。提高程序运行效率的一种有效方法是采用多线程机制。

JSP是Java Server Pages 的简称，顾名思义是服务器端的一种基于Java语言的网页技

术。JSP正式发布于1999年6月，它是由美国SUN公司倡导，多家公司合作建立的一种

功能强大的动态网页技术标准，用于创建可支持跨平台及跨Web服务器的动态网页[6]。

1.2.5 SPRING MVC

Spring MVC属于SpringFrameWork的后续产品，已经融合在Spring Web Flow里面。Spring 框架提供了构建Web 应用程序的全功能MVC 模块[7]。相比于Struts，Spring MVC 使用简单，学习成本低，灵活性高，很容易写出性能优秀的程序。

1.3 论文组织结构

论文第1章首先介绍了本系统的开发背景和意义，以及使用到的开发工具、技术及开发环境，第2章叙述了可行性研究和需求分析，第3章和第4章分别是系统的总体设计和详细设计，第5章是系统的测试内容和结果。论文的最后对全文进行总结和展望。

第2章可行性研究和需求分析

2.1 可行性研究

系统开发所需的硬件为普通计算机一台，计算机的操作系统是Windows7 32位，所使用的开发工具包括MyEclipse、SQL Server 2005和Tomcat，开发成本较低。用户使用本系统只需一台带有浏览器并可以连接Internet的计算机，因为系统为B/S结构，所以维护起来较为简单。

系统以MyEclipse作为前台开发工具，以SQL Server 2005作为后台数据库。通过结合Java语言的完全面向对象，JSP语言的简单方便以及SQL强大的查询语言开发出来的系统可以准确、快速、安全地运行。当系统完成时，可以将其打包并发布到服务器上，用户可以通过计算机打开浏览器访问到本系统[8]。

综上，系统开发可行。

2.2 需求分析

网络百宝箱系统为注册用户提供一系列方便、快捷的网络工具，使得用户对信息的存取变得简单，可以及时地存储重要的通讯录，对生活琐事进行记录或者备忘计划的事，收藏常用的网站以及备份重要的文件。

建立网络百宝箱系统，需要的功能主要有：

1.用户注册及登录

分别设置个人用户注册及登录和系统用户登录两种用户类型。用户在填写了相应的一些基本信息如用户名密码后，点击“注册”按钮即可完成，获得自己的用户名和密码，以此来登录系统。

2.通讯录

用户在登录以后，可以录入自己的通讯录，保存联系人的姓名、生日、联系地址、QQ、邮箱、电话等信息。可以随时对通讯录进行查看、修改、删除，可以对联系人信息进行快速查询。

3. 记事本

用户在登录以后，可以记录个人的日常琐事，或者备忘计划中的事情。可以随时查看、修改、删除、记事本中的内容。

4. 收藏夹

用户在登录以后，可以收藏自己常用的网络地址，并添加备注信息。可以随时查看、修改、删除、收藏夹中的内容。

5. 储物箱

用户在登录以后，可以上传文件，并添加备注信息。可以随时查看、修改、删除其中内容。

6. 系统用户

系统用户在登录以后，可以对所有用户信息进行维护，并管理所有用户的相关信息，可以对其基本信息进行查看、修改或对整个用户进行增加、删除操作。

第3章系统总体设计

3.1 系统功能描述

本系统是一个基于JSP的网络百宝箱系统，有两个权限即系统用户权限和用户权限[9]。

系统用户权限主要包括了以下功能模块：

●用户管理。可以查看所有用户信息，可以对用户基本信息详情进行查看，修改。可以删除用户，也可以新增用户。

用户权限主要包括了以下几个功能模块：

●记事本管理。可以查看自己记事本信息，可对记事本进行查看，修改，删除等操作，可以新建记事本。

●通讯录管理。可以查看自己联系人信息，可对联系人进行查看，修改，删除，分组等操作，可以新建联系人。

●收藏夹管理。可以查看自己收藏夹信息，可对收藏夹进行查看，修改，删除等操作，可以新建收藏夹。

●储物箱管理。可以查看自己文件夹信息，可对文件夹进行查看，修改，删除等操作，可上传新文件。

●个人信息管理。可以查看个人信息，进行个人信息以及密码修改等操作。

3.2 系统功能框架示意图

各模块功能框架示意图如图3-1至3-9所示：

图3-1 系统用户拥有的功能

图3-2 用户拥有的功能

系统用户

用户管理

用户

记事本管理

联系人分组管理

通讯录管理收藏夹管理个人信息修改

储物箱管理

图3-3 记事本管理

图3-4 联系人分组管理

图3-5 通讯录管理

通讯录管理

新建联系人

查询

修改联系人信息

删除联系人

联系人分组管理

查询查询

修改标题内容

删除记事本

新建记事本

记事本管理

图3-6 收藏夹管理

图3-7 储物箱管理

图3-8 用户管理

收藏夹

管理查询

新建收藏

删除收藏

修改信息储物箱管理修改标题内容

删除文件上传文件

查询

下载文件

查询

修改个人信息删除用户

新建用户

用户管理

图3-9 系统总功能模块图

3.3 数据库设计 3.3.1数据库需求分析

针对网络百宝箱系统，对记事本相关信息、通讯录相关信息、收藏夹相关信息、储物箱相关信息以及使用用户信息等进行详细的调研和分析，总结出如下的需求信息：

系统用户，拥有最高权限，管理所有用户。系统用户信息需要用户名和密码属性。

用户信息除了需要用户名密码以外，还需要一些相关的基本信息比如姓名、邮箱、单位、创建时间、创建人、修改人、更新时间等属性。

记事本信息应该有最基本的标题以及内容，除此之外，需要一个表示发布时间的属性。记事本还需要指明属于哪个用户。

联系人信息需要姓名、生日、地址、电话、QQ 、邮箱等基本属性，此外为了方便区分联系人，还应该设置联系人分组，需要一张联系人分组表，联系人还需要指明属于哪个用

通讯录管理

查看联系人

添加联系人

删除联系人

修改联系人

记事本管理

查看记事

本添加记事

本删除记事

本修改记事

本收藏夹管理

查看收藏夹添加收藏

夹删除收藏

夹修改收藏

夹

储物箱管理

查看文

件上传和下载

删除文

件修改标题

内容

用户管理查看用户

添加用户

删除用

户修改用

户

网络百宝箱用户

系统用户

修改个人信息

个人信息管理

户，哪个分组。

联系人分组信息需要名称、创建时间等属性。

收藏夹信息需要URL 、备注、添加时间等属性。需指明属于哪个用户。文件夹信息需要标题、内容、创建时间，物理路径等。需指明属于哪个用户。经上述系统功能分析和需求总结，考虑到将来功能的扩展，设计如下的数据表和数据项：

系统用户信息表，包括数据项有：编号、用户名、密码、创建时间等。

用户信息表，包括数据项有：编号、用户名、密码、创建时间、创建人、更新时间、修改人、姓名、单位、邮箱等。

记事本信息表，包括数据项有：标题、内容、创建时间、归属用户等。联系人分组信息表，包括数据项有：名称、创建时间等。

联系人信息表，包括数据项有：姓名、生日、地址、电话、QQ 、邮箱、归属用户、归属分组等。

收藏夹信息表，包括数据项有：URL 、备注、时间、归属用户等。文件夹信息表，包括数据项有：标题、内容、创建时间、归属用户等。

3.3.3 数据库E-R 图

通过对系统进行需求分析，规划出数据库各表的实体关系，如图3-10至3-17所示。

图3-10 系统用户实体图

系统用户

用户

编号

用户名

密码

创建时间

图3-11 用户实体图

图3-12 记事本实体图

用户用户编号

用户名

密码

创建时间

创建人

更新时间

修改人

姓名

单位

邮箱

记事本

内容

用户ID

创建时间

标题

图3-13 联系人分组实体图

图3-14 联系人实体图

图3-15 收藏夹实体图

联系人分组

名称

创建时间

联系人

姓名

生日

地址

电话

邮箱

用户ID

分组ID

收藏夹

备注时间

所属用户ID

URL

图3-16 文件夹实体图

图3-17 系统主要部分E-R 图

3.3.2 数据库表结构

本系统数据库名为gallery ，共包含7张数据库表：User_BaseInfo 、User_ManageInfo 、User_Contact 、User_ContactGroup 、User_Notepad 、User_Favourite 、User_file ，表3-1至3-7是各表的结构：

文件夹

内容

创建时间

所属用户ID

标题

用户

管理

添加

管理

文件夹

N 管理记事本

N 管理收藏夹

N 管理联系人分组

N 管理

联系人

N 1 1

1 1 1

系统用户

表3-1 User_BaseInfo用户基本信息表

字段名称数据类型及大小说明id int 用户编号（外键，主键）name varchar(32) 用户名passWd varchar(32) 密码CreateTime datetime 创建时间Creator varchar(32) 创建人UpdateTime datetime 更新时间Modifier varchar(32) 修改人userName varchar(32) 姓名unit varchar(32) 单位

email varchar(32) 邮箱

表3-2 User_ManageInfo系统用户信息表

字段名称数据类型及大小说明id int 用户编号（主键）name varchar(32) 用户名passWd varchar(32) 密码CreateTime datetime 创建时间

表3-3 User_Contact联系人表

id int ID（主键）

name varchar(32) 姓名

birthday datetime 生日

address varchar(32) 地址

mobile varchar(32) 电话

qq varchar(32) qq

mail varchar(32) 邮箱

userId int 用户id（外键）groupId int 分组id（外键）

表3-4 User_ContactGroup联系人分组表

字段名称数据类型及大小说明id int ID（外键，主键）name varchar(32) 名称

time datetime 创建时间

表3-5 User_Notepad记事本表

字段名称数据类型及大小说明id int ID（主键）title varchar(32) 标题content varchar(32) 内容

time datetime 创建时间userId int 用户id（外键）

表3-6 User_Favourite收藏夹表

字段名称数据类型及大小说明id int ID（主键）url varchar(100) URL memo varchar(1000) 备注

time datetime 时间userId int 用户id（外键）

表3-7 User_file文件管理表

字段名称数据类型及大小说明id int ID（主键）title varchar(32) 标题content varchar(1000) 内容

time datetime 创建时间userId int 用户id（外键）

山东建筑大学计算机网络课程设计基于Python的网络爬虫设计

山东建筑大学课程设计成果报告题目：基于Python的网络爬虫设计课程：计算机网络A 院（部）：管理工程学院专业：信息管理与信息系统班级：学生姓名：学号：指导教师：完成日期：

目录 1 设计目的 0 2 设计任务内容 0 3 网络爬虫程序总体设计 0 4 网络爬虫程序详细设计 0 4.1 设计环境和目标分析 0 4.1.1 设计环境 0 4.1.2 目标分析 (1) 4.2 爬虫运行流程分析 (1) 4.3 控制模块详细设计 (2) 4.3 爬虫模块详细设计 (2) 4.3.1 URL管理器设计 (2) 4.3.2 网页下载器设计 (2) 4.3.3 网页解析器设计 (2) 4.4数据输出器详细设计 (3) 5 调试与测试 (3) 5.1 调试过程中遇到的问题 (3) 5.2测试数据及结果显示 (4) 6 课程设计心得与体会 (4) 7 参考文献 (5) 8 附录1 网络爬虫程序设计代码 (5) 9 附录2 网络爬虫爬取的数据文档 (8)

1 设计目的本课程设计是信息管理与信息系统专业重要的实践性环节之一，是在学生学习完《计算机网络》课程后进行的一次全面的综合练习。本课程设计的目的和任务： 1．巩固和加深学生对计算机网络基本知识的理解和掌握； 2．培养学生进行对网络规划、管理及配置的能力或加深对网络协议体系结构的理解或提高网络编程能力； 3．提高学生进行技术总结和撰写说明书的能力。 2 设计任务内容网络爬虫是从web中发现,下载以及存储内容，是搜索引擎的核心部分。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列，直到满足系统的一定停止条件。参照开放源码分析网络爬虫实现方法，给出设计方案，画出设计流程图。选择自己熟悉的开发环境，实现网络爬虫抓取页面、从而形成结构化数据的基本功能，界面适当美化。给出软件测试结果。 3 网络爬虫程序总体设计在本爬虫程序中共有三个模块： 1、爬虫调度端：启动爬虫，停止爬虫，监视爬虫的运行情况 2、爬虫模块：包含三个小模块，URL管理器、网页下载器、网页解析器。（1）URL管理器：对需要爬取的URL和已经爬取过的URL进行管理，可以从URL 管理器中取出一个待爬取的URL，传递给网页下载器。（2）网页下载器：网页下载器将URL指定的网页下载下来，存储成一个字符串，传递给网页解析器。（3）网页解析器：网页解析器解析传递的字符串，解析器不仅可以解析出需要爬取的数据，而且还可以解析出每一个网页指向其他网页的URL，这些URL被解析出来会补充进URL管理器 3、数据输出模块：存储爬取的数据 4 网络爬虫程序详细设计 4.1 设计环境和目标分析 4.1.1 设计环境

基于Socket网络聊天系统的设计与实现

摘要随着Internet的飞速发展，网络聊天以其操作简单、方便快捷、私密性好等优点已经迅速发展成为最普遍的网络交流方式之一，越来越受到人们的青睐，丰富了人们的网上生活。开发并实现具有自身特色的网络聊天系统具有实际应用价值。本网络聊天系统基于Java应用程序设计，以Client/Server为开发模式，以Eclipse为开发环境，以MySQL为后台数据库，利用JDBC连接数据库。系统主要包括服务器模块和客户端模块，服务器模块能够对客户端发来的用户信息进行匹配、读取和转发；客户端模块能够进行注册、登录、聊天和文件传输。系统不但实现了点到点的聊天，还利用Java提供的Socket类和多线程功能，在单个程序中同时运行多个不同进程，从而实现多点对多点的聊天。总之，该聊天系统具有开放性，实时性，多话题交错等特点，方便了人们网上交流。【关键词】网络聊天服务器模块客户端模块 Socket

ABSTRACT With the rapid development of Internet, network chat with its simple operation, convenient and gond privacy has quickly become the most popular way of communication networks, more and more people like it, enrich people's online lives. Development and Realization of the network chat system with its own characteristics and has practical application value. The Internet chat system is based on Java application, designed by Client / Server as the development of models, as Eclipse development environment, MySQL as the backend database, and using JDBC to connect database. The system includes server modules and client modules, server module can match users'data, read and forward the information which is sent by client; client module to regist, login, chat and file transfer. The system not only achieves peer-to-peer chat, but also use the Java provids Socket class and multi-threading capabilities, in a single program run different processes at the same time, in order to achieve multipoint chat. In short, the chat system is open, real-time and multi-topic staggered features, easy for people to communicate online. 【Key words】Network Chat Client Module Server Module Socket 目录

基于python的网络爬虫设计

基于p y t h o n的网络爬虫设计 Last updated on the afternoon of January 3, 2021

基于python的网络爬虫设计【摘要】近年来，随着网络应用的逐渐扩展和深入，如何高效的获取网上数据成为了无数公司和个人的追求，在大数据时代，谁掌握了更多的数据，谁就可以获得更高的利益，而网络爬虫是其中最为常用的一种从网上爬取数据的手段。网络爬虫，即WebSpider，是一个很形象的名字。如果把互联网比喻成一个蜘蛛网，那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页的。从网站某一个页面（通常是首页）开始，读取网页的内容，找到在网页中的其它链接地址，然后通过这些链接地址寻找下一个网页，这样一直循环下去，直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站，那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。那么，既然网络爬虫有着如此先进快捷的特点，我们该如何实现它呢？在众多面向对象的语言中，首选python，因为python是一种“解释型的、面向对象的、带有动态语义的”高级程序，可以使人在编程时保持自己的风格，并且编写的程序清晰易懂，有着很广阔的应用前景。关键词python爬虫数据 1前言本编程设计的目的和意义随着网络的迅速发展，万维网成为大量信息的载体，如何有效地提取并利用这些信息成为一个巨大的挑战。搜索引擎（例如传统的通用搜索引擎AltaVista，Yahoo!和Google等）作为一个辅助人们检索信息的工具成为用户访问万维网的入口和指南。但是，这些通用性搜索引擎也存在着一定的局限性，如：(1)不同领域、不同背景的用户往往具有不同的检索目的和需求，通用搜索引擎所返回的结果包含大量用户不关心的网页。(2)通用搜索引擎的目标是尽可能大的网络覆盖率，有限的搜索引擎服务器资源与无限的网络数据资源之间的矛盾将进一步加深。(3)万维网数据形式的丰富和网络技术的不断发展，图片、数据库、音频/视频多媒体等不同数据大量出现，通用搜索引擎往往对这些信息含量密集且具有一定结构的数据无能为力，不能很好地发现和获取。(4)通用搜索引擎大多提供基于关键字的检索，难以支持根据语义信息提出的查询。为了解决上述问题，定向抓取相关网页资源的聚焦爬虫应运而生。聚焦爬虫是一个自动下载网页的程序，它根据既定的抓取目标，有选择的访问万维网上的网页与相关的链接，获取所需要的信息。与通用爬虫(generalpurposewebcrawler)不同，聚焦爬虫并不追求大的覆盖，而将目标定为抓取与某一特定主题内容相关的网页，为面向主题的用户查询准备数据资源。编程设计目及思路学习了解并熟练掌握python的语法规则和基本使用，对网络爬虫的基础知识进行了一定程度的理解，提高对网页源代码的认知水平，学习用正则表达式来完成匹配查找的工作，了解数据库的用途，学习mongodb数据库的安装和使用，及配合python的工作。（1)以世纪佳缘网为例，思考自己所需要的数据资源，并以此为基础设计自己的爬虫程序。（2)应用python伪装成浏览器自动登陆世纪佳缘网，加入变量打开多个网页。（3)通过python的urllib2函数进行世纪佳缘网源代码的获取。（4)用正则表达式分析源代码，找到所需信息导入excel。

网络爬虫课程设计文档

网络爬虫网络爬虫是一个自动提取网页的程序，它为搜索引擎从万维网上下载网页，是搜索引擎的重要组成。传统爬虫从一个或若干初始网页的URL开始，获得初始网页上的URL，在抓取网页的过程中，不断从当前页面上抽取新的URL放入队列，直到满足系统的一定停止条件。简单来说，网络爬虫的基本工作流程可以分为如下几步： 1.首先选取一部分精心挑选的种子URL； 2.将这些URL放入待抓取URL队列； 3.从待抓取URL队列中取出待抓取URL，解析DNS，并且得到主机的ip，并将URL对应的网页下载下来，存储进已下载网页库中。此外，将这些URL放进已抓取URL队列。 4.分析已抓取URL队列中的URL，并且将URL放入待抓取URL队列，从而进入下一个循环。对URL的认识爬虫最主要的处理对象就是URL，它根据URL地址取得所需要的文件内容，然后对它进行进一步的处理。因此，准确地理解URL对理解网络爬虫至关重要。 URL：统一资源定位符，是Internet 上描述信息资源的字符串。URL可以用一种统一的格式来描述各种信息资源，包括文件、服务器的地址和目录等。URL 的格式由三部分组成：第一部分是协议(或称为服务方式)。第二部分是存有该资源的主机IP地址(有时也包括端口号)。第三部分是主机资源的具体地址，如目录和文件名等。第一部分和第二部分用“://”符号隔开，第二部分和第三部分用“/”符号隔开。第一部分和第二部分是不可缺少的，第三部分有时可以省略。 1.HTTP 协议的URL 示例

使用超级文本传输协议HTTP，提供超级文本信息服务的资源。例：https://www.doczj.com/doc/ae5078707.html,/channel/welcome.htm。其计算机域名为https://www.doczj.com/doc/ae5078707.html,。超级文本文件(文件类型为.html)是在目录/channel 下的welcome.htm。这是中国人民日报的一台计算机。例：https://www.doczj.com/doc/ae5078707.html,/talk/talk1.htm。其计算机域名为https://www.doczj.com/doc/ae5078707.html,。超级文本文件(文件类型为.html)是在目录/talk 下的talk1.htm。 2．文件的URL 用URL表示文件时，服务器方式用file表示，后面要有主机IP 地址、文件的存取路径(即目录)和文件名等信息。有时可以省略目录和文件名，但“/”符号不能省略。例：file://https://www.doczj.com/doc/ae5078707.html,/pub/files/foobar.txt。代表存放在主机https://www.doczj.com/doc/ae5078707.html, 上的pub/files/目录下的一个文件，文件名是foobar.txt。例：file://https://www.doczj.com/doc/ae5078707.html,/pub。代表主机https://www.doczj.com/doc/ae5078707.html, 上的目录/pub。例：file://https://www.doczj.com/doc/ae5078707.html,/。代表主机https://www.doczj.com/doc/ae5078707.html, 的根目录。通过URL抓取网页 1.抓取单个网页所谓网页抓取，就是把URL 地址中指定的网络资源从网络流中读取出来，保存到本地。类似于使用程序模拟IE 浏览器的功能，把URL 作为HTTP 请求的内容发送到服务器端，然后读取服务器端的响应资源。 Java网页抓取 Java 语言把网络资源看成是一种文件，它对网络资源的访问和对本地文件的访问一样方便。它把请求和响应封装为流。因此我们可以根据相应内容，获得响应流，之后从流中按字节读取数据。例如，https://www.doczj.com/doc/ae5078707.html,.URL 类可以对相应的Web服务器发出请求并且获得响应文档。https://www.doczj.com/doc/ae5078707.html,.URL 类有一个默认的构造函数，使用URL 地址作为参数，构造URL 对象：URL pageURL = new URL(path);接着，可以通过获得的URL对象来取得网络流，进而像操作本地文件一样来操作网络资源：InputStream stream = pageURL.openStream()。 HttpClient Get方法在实际的项目中，网络环境比较复杂。因此，只用https://www.doczj.com/doc/ae5078707.html, 包中的API来模拟IE客户端的工作，会产生很大的代码量。需要处理HTTP返回的状态码，设置HTTP代理，处理HTTPS 协议等工作。为了便于应用程序的开发，实际开发时常常使用Apache 的HTTP客户端开源项目——HttpClient。它完全能够处理HTTP 连接中的各种问题，使用起来非常方便。只需在项目中引入HttpClient.jar 包，就可以模拟IE 来获取网页内容。例如： //创建一个客户端，类似于打开一个浏览器 HttpClient httpclient=new HttpClient(); //创建一个get 方法，类似于在浏览器地址栏中输入一个地址

网页设计大作业word模板

伊犁师范学院《网页设计》期末课程设计设计题目：我的个人网页学号：018 姓名：马建武院系：电子与信息工程学院专业班级：计科08-2 指导老师：王雪峰日期：2011-6-20

一、设计思想随着网络技术的飞速发展，网络已经遍及每个人的身边，通过个人网页把自己展示在网络上，不仅可以获得更多的朋友，有用的信息，也是跟随时代发展，做走在时代前沿的一个有效方式，本网站旨在设计一个个性化的个人网站，展现自己的生活，学习，爱好等等信息，通过本网站把自己展示出来。二、开发环境及软件 Windows XP，Macromedia Dreamweaver 8，photoshop等三、系统结构功能图、页面结构草图及部分页面截图四、部分代码（主要添加CSS代码） 1.添加首页背景音乐 2.运用框架