python-ox/ox/web/metacritic.py

# -*- coding: utf-8 -*-
# vi:si:et:sw=4:sts=4:ts=4
import re

from six.moves.urllib.parse import quote
from lxml.html import document_fromstring

from ox.cache import read_url
from ox import find_re, strip_tags

def get_url(id=None, imdb=None):
    if imdb:
        url = "http://www.imdb.com/title/tt%s/criticreviews" % imdb
        data = read_url(url)
        metacritic_url = find_re(data, '"(http://www.metacritic.com/movie/.*?)"')
        return metacritic_url or None
    return 'http://www.metacritic.com/movie/%s' % id

def get_id(url):
    return url.split('/')[-1]

def get_show_url(title):
    title = quote(title)
    url = "http://www.metacritic.com/search/process?ty=6&ts=%s&tfs=tvshow_title&x=0&y=0&sb=0&release_date_s=&release_date_e=&metascore_s=&metascore_e=" % title
    data = read_url(url)
    return find_re(data, '(http://www.metacritic.com/tv/shows/.*?)\?')

def get_data(url):
    data = read_url(url, unicode=True)
    doc = document_fromstring(data)
    score = [s for s in doc.xpath('//span[@class="score_value"]')
             if s.attrib.get('property') == 'v:average']
    if score:
        score = int(score[0].text)
    else:
        score = -1
    authors = [
        a.text
        for a in doc.xpath('//div[@class="review_content"]//div[@class="author"]//a')
    ]
    sources = [
        d.text
        for d in doc.xpath('//div[@class="review_content"]//div[@class="source"]/a')
    ]
    reviews = [
        d.text
        for d in doc.xpath('//div[@class="review_content"]//div[@class="review_body"]')
    ]
    scores = [
        int(d.text.strip())
        for d in doc.xpath('//div[@class="review_content"]//div[contains(@class, "critscore")]')
    ]
    urls = [
        a.attrib['href']
        for a in doc.xpath('//div[@class="review_content"]//a[contains(@class, "external")]')
    ]

    metacritics = []
    for i in range(len(authors)):
        metacritics.append({
            'critic': authors[i],
            'url': urls[i],
            'source': sources[i],
            'quote': strip_tags(reviews[i]).strip(),
            'score': scores[i],
        })

    return {
        'critics': metacritics,
        'id': get_id(url),
        'score': score,
        'url': url,
    }
add ox.web to this repos 2010-07-07 23:25:57 +00:00			`# -- coding: utf-8 --`
			`# vi:si:et:sw=4:sts=4:ts=4`
			`import re`
more python3 cleanups 2014-10-02 08:28:22 +00:00
i really likes movies, s/six.movies/six.moves/ 2014-10-02 18:17:31 +00:00			`from six.moves.urllib.parse import quote`
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`from lxml.html import document_fromstring`
add ox.web to this repos 2010-07-07 23:25:57 +00:00
net/cache readUrl->read_url / Unicode -> unicode=True format replace all CammelCase with under_score 2012-08-14 13:58:05 +00:00			`from ox.cache import read_url`
replace all CammelCase with under_score in ox 2012-08-14 14:12:43 +00:00			`from ox import find_re, strip_tags`
add ox.web to this repos 2010-07-07 23:25:57 +00:00
ox.web under_score api rewrite 2012-08-15 15:15:40 +00:00			`def get_url(id=None, imdb=None):`
			`if imdb:`
			`url = "http://www.imdb.com/title/tt%s/criticreviews" % imdb`
			`data = read_url(url)`
			`metacritic_url = find_re(data, '"(http://www.metacritic.com/movie/.*?)"')`
			`return metacritic_url or None`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`return 'http://www.metacritic.com/movie/%s' % id`

ox.web under_score api rewrite 2012-08-15 15:15:40 +00:00			`def get_id(url):`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`return url.split('/')[-1]`

ox.web under_score api rewrite 2012-08-15 15:15:40 +00:00			`def get_show_url(title):`
add ox.web to this repos 2010-07-07 23:25:57 +00:00			`title = quote(title)`
			`url = "http://www.metacritic.com/search/process?ty=6&ts=%s&tfs=tvshow_title&x=0&y=0&sb=0&release_date_s=&release_date_e=&metascore_s=&metascore_e=" % title`
net/cache readUrl->read_url / Unicode -> unicode=True format replace all CammelCase with under_score 2012-08-14 13:58:05 +00:00			`data = read_url(url)`
replace all CammelCase with under_score in ox 2012-08-14 14:12:43 +00:00			`return find_re(data, '(http://www.metacritic.com/tv/shows/.*?)\?')`
add ox.web to this repos 2010-07-07 23:25:57 +00:00
ox.web under_score api rewrite 2012-08-15 15:15:40 +00:00			`def get_data(url):`
net/cache readUrl->read_url / Unicode -> unicode=True format replace all CammelCase with under_score 2012-08-14 13:58:05 +00:00			`data = read_url(url, unicode=True)`
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`doc = document_fromstring(data)`
cleanup pylint errors and py2/3 issues 2016-06-08 13:32:46 +00:00			`score = [s for s in doc.xpath('//span[@class="score_value"]')`
			`if s.attrib.get('property') == 'v:average']`
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`if score:`
			`score = int(score[0].text)`
			`else:`
			`score = -1`
cleanup pylint errors and py2/3 issues 2016-06-08 13:32:46 +00:00			`authors = [`
			`a.text`
			`for a in doc.xpath('//div[@class="review_content"]//div[@class="author"]//a')`
			`]`
			`sources = [`
			`d.text`
			`for d in doc.xpath('//div[@class="review_content"]//div[@class="source"]/a')`
			`]`
			`reviews = [`
			`d.text`
			`for d in doc.xpath('//div[@class="review_content"]//div[@class="review_body"]')`
			`]`
			`scores = [`
			`int(d.text.strip())`
			`for d in doc.xpath('//div[@class="review_content"]//div[contains(@class, "critscore")]')`
			`]`
			`urls = [`
			`a.attrib['href']`
			`for a in doc.xpath('//div[@class="review_content"]//a[contains(@class, "external")]')`
			`]`
add ox.web to this repos 2010-07-07 23:25:57 +00:00
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`metacritics = []`
			`for i in range(len(authors)):`
			`metacritics.append({`
			`'critic': authors[i],`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`'url': urls[i],`
			`'source': sources[i],`
net/cache readUrl->read_url / Unicode -> unicode=True format replace all CammelCase with under_score 2012-08-14 13:58:05 +00:00			`'quote': strip_tags(reviews[i]).strip(),`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`'score': scores[i],`
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`})`
cleanup pylint errors and py2/3 issues 2016-06-08 13:32:46 +00:00
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`return {`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`'critics': metacritics,`
ox.web under_score api rewrite 2012-08-15 15:15:40 +00:00			`'id': get_id(url),`
cleanup metacritic 2012-07-08 11:16:59 +00:00			`'score': score,`
			`'url': url,`
update rottentomatoes and metacritic 2012-07-08 11:09:58 +00:00			`}`
add ox.web to this repos 2010-07-07 23:25:57 +00:00