Chỉnh sửa 09/2016: Trong Python 3 trở lên, hãy sử dụng urllib.request thay vì urllib2
Thực ra cách đơn giản nhất là:
import urllib2 # the lib that handles the url stuff
data = urllib2.urlopen(target_url) # it's a file like object and works just like a file
for line in data: # files are iterable
print line
Bạn thậm chí không cần "đường đọc", như Will đề xuất. Bạn thậm chí có thể rút ngắn nó thành: *
import urllib2
for line in urllib2.urlopen(target_url):
print line
Nhưng hãy nhớ trong Python, khả năng đọc rất quan trọng.
Tuy nhiên, đây là cách đơn giản nhất nhưng không phải là cách an toàn vì hầu hết khi lập trình mạng, bạn không biết liệu lượng dữ liệu mong đợi có được tôn trọng hay không. Vì vậy, tốt hơn hết bạn nên đọc một lượng dữ liệu cố định và hợp lý, điều gì đó bạn biết là đủ cho dữ liệu bạn mong đợi nhưng sẽ ngăn tập lệnh của bạn không bị ngập:
import urllib2
data = urllib2.urlopen("http://www.google.com").read(20000) # read only 20 000 chars
data = data.split("\n") # then split it into lines
for line in data:
print line
* Ví dụ thứ hai trong Python 3:
import urllib.request # the lib that handles the url stuff
for line in urllib.request.urlopen(target_url):
print(line.decode('utf-8')) #utf-8 or iso8859-1 or whatever the page encoding scheme is