Accéder au contenu principal

Articles

Script final, ou presque..

  SCRIPT   Avant de montrer ce scritp qui a été paufiné toute au long du sémestre, il est important de remarquer que même si celui-ci est un pe Nous sommes parvenus à avoir un scritp qui fonctionne bien pour presque toutes nos langues. Il y a des modification dans celui du japonais, mais pour l'anglais, l'espagnol, le français et le turc celui-ci fonctionne bien. Dans cette entrée nous allons montrer le script que nous avons travaillé tout au long du semestre pour notre projet     Dans cette première partie nous établissons les fonctions pour les dossiers des URL, pour créer le tableau et pour reconnaître notre motif.  Le premier traitement correspond au fichier URL, pour chaque fichier nous créons un tableau pour les URL’s Ici quelques captures d’écran des tableaux en français et en espagnol. Dans cette boucle while on traite nos URL, on met chacune sur  une ligne et à l’aide de la commande curl on vérifie la valeur http_code. Ensuite, si l'encodage d...

Petit moment d'exercices pratiques

 Dans cette partie (qui sera plutôt courte), on cherche à s'exercer sur l'utilisation de la commande curl. La question se pose donc sur la fiabilité de nos URLs. Est ce que la récupération d'un URL s'est bien passé ? On se lance donc avec l'url suivant : yagmur@LAPTOP-7LSSEII1:~/PROJET-MOT-SUR-LE-WEB$ curl http://www.lemonde.fr -w %{http_code} 301 HTTP STATUS CODES: 1xx informational response - the resquest was received, continuing process 2xx successful - the request was successfully received, understood and accepted 3xx redirection - further action needs to be taken in order to complete the request 4xx client error - the request contains bad syntax or cannot be fulfilled 5xx server error - the server failed to fulfil an apparently valid request Pour mieux vérifier, on procède donc de la façon suivante : retourcurl=$(curl http://www.lemonde.fr -w %{http_code}) % Total % Received % Xferd Average Speed Time Time Time Current Dlo...

Session 4 partie b: Let's Make Out now

 Après avoir vu la récupération des URLs pour l'espagnol et le français, on s'attaque maintenant à la constitution du corpus côté Anglophone et turcophone. A noter que la version anglophone de French kiss restera bien évidemment French kiss , et que la version turc sera : " Fransız öpücüğü ". Démonstration : Comme pour la langue espagnole et française, on commence par extraire les URLs sur le terminale de ubuntu. Récolte des URLs Anglais : La commande utilisée pour y procéder : counter=0; while [ $counter -le 300 ]; do lynx -dump "https://www.google.com/search?q=%22french+kiss%22&lr=lang_en&cr=countryUK%7CcountryGB&hl=en&as_qdr=all&tbs=lr:lang_1en,ctr:countryUK%7CcountryGB&sxsrf=ALeKk035znO7MnlS20oHUA1OFucKsI-3uA:1607455178745&ei=ytHPX_b6LMWIae7TqbAG&start=$counter&sa=N&ved=2ahUKEwj2h6-Xjb_tAhVFRBoKHe5pCmYQ8tMDegQIDhA7" >> uk_urls.txt; counter=$(($counter + 20));done //!\\ On fait bien attention de changer le ...

Session 4: un french, un beso, french kissing...

Un beso con lengua, Frencher! Dans cette partie, il sera montré quelques résultats par pair de langue Nous allons commencer par présenter nos recherches en espagnol, et en français. Petite remarque avant de continuer plus loin : en espagnol, le terme "French Kiss" se traduit en espagnol par "Beso con lengua". Il sera donc ici détaillé la façon dont on a procédé pour "Beso con lengua": La première commande est pour trouver les URLs en espagnol du mot "beso con lengua" ou son autre version aussi trouvé : "beso francés". Pour le cas de "beso con lengua" Commande :  counter=0; while [ $counter -le 300 ]; do lynx -dump "https://www.google.com/search?q=suburbs&client=ubuntu&channel=fs&biw=1494&bih=657&sxsrf=ALeKk011piWSj9r1StcMMmaC2Fwkb8FqNg:1603092362766&ei=ij-NX7-dLquJjLsPzLqSsAw&start=$counter&sa=N&ved=2ahUKEwi_isy2kMDsAhWrBGMBHUydBMY4FBDy0wN6BAgWEDM">> mes_liens_bruts.txt; coun...

Session 3 partie b

 Donc pour revenir à toute ces histoires d'URLs, la commande lynx nous permet de les récupérer tout comme le ferait la commande wget à l'exception que lynx nous permet d'obtenir une page Google dans un format texte. La commande est donc la suivante: lynx -dump "URL_de_la_page_google" > banlieues_google.txt lynx -dump "https://www.google.com/search?q=french+kiss&rlz=1C5CHFA_enFR921FR921&oq=french+kiss&aqs=chrome.0.69i59j0j46j0l2j69i60l2j69i61.12972j1j7&sourceid=chrome&ie=UTF-8" > frenchkissfr_google Et maintenant que nous en avons extrait, nous pouvons les garder dans un fichier urls, créer à notre première séance: En tapant less frenchkissfr_google on visualise les résultats  : On veut par la suite récupérer les URL pour les mettre dans un fichier txt. Nous avons recours ici à la fonction egrep. Grâce à cette expression régulière on pourra isoler uniquement les URL de nos fichiers. récupérer des URL counter=0; while [ $counter ...