Accéder au contenu principal

Session 4 partie b: Let's Make Out now

 Après avoir vu la récupération des URLs pour l'espagnol et le français, on s'attaque maintenant à la constitution du corpus côté Anglophone et turcophone.

A noter que la version anglophone de French kiss restera bien évidemment French kiss, et que la version turc sera : "Fransız öpücüğü".

Démonstration :

Comme pour la langue espagnole et française, on commence par extraire les URLs sur le terminale de ubuntu.

Récolte des URLs Anglais :

La commande utilisée pour y procéder :

counter=0; while [ $counter -le 300 ]; do lynx -dump "https://www.google.com/search?q=%22french+kiss%22&lr=lang_en&cr=countryUK%7CcountryGB&hl=en&as_qdr=all&tbs=lr:lang_1en,ctr:countryUK%7CcountryGB&sxsrf=ALeKk035znO7MnlS20oHUA1OFucKsI-3uA:1607455178745&ei=ytHPX_b6LMWIae7TqbAG&start=$counter&sa=N&ved=2ahUKEwj2h6-Xjb_tAhVFRBoKHe5pCmYQ8tMDegQIDhA7" >> uk_urls.txt; counter=$(($counter + 20));done

//!\\ On fait bien attention de changer le "start=10" en "start=$counter". 

Remarque: On se concentre uniquement sur la récolte d'URLs du côté des anglophones d'outre Manche (je parle bien évidemment de l'anglais Britannique). C'est déjà assez éloigné comme ça, haha. De plus, on tiendra aussi en compte le fait que la version "vulgarisée" de French kiss est "to make out" du côté de nos voisins Etats-Uniens. Personne ne dirait d'après des natifs anglais américains "I'm going to French kiss you" mais plus "Let's make (it) out!".

Petite session nettoyage à présent :


C'est bien entendu la commande egrep qui nous désert :

egrep "^  [0-9]+\." uk_urls.txt | cut -d"=" -f2 | cut -d"&" -f1 | egrep "^http[s]?" | egrep -v google | egrep -v jpg | egrep -v jpeg | egrep -v youtube |egrep -v wav | egrep -v width | egrep -v dictionary > try_uk.txt

mv try_uk.txt english_urls.txt

On obtient ainsi les données suivantes :


Tout cela n'a pas l'air si mauvais... On verra pour la création du tableau par la suite.

En attendant, on va s'attaquer à la récolte des URLs pour la notre corpus turc.

Récolte des URLs pour le corpus en turc

C'est partie, on recommence la récolte avec la commande $counter :


On passe maintenant au nettoyage et triage des URLs, toujours avec egrep :

egrep "^  [0-9]+\." tr_urls.txt | cut -d"=" -f2 | cut -d"&" -f1 | egrep "^http[s]?" | egrep -v google | egrep -v sözlük | egrep -v jpg | egrep -v jpeg | egrep -v wav | egrep -v width | egrep -v youtube | egrep -v facebook | egrep -v photos > turkish_urls.txt 

Résultat :


Commentaires

Posts les plus consultés de ce blog

Concaténation et nettoyage du corpus.

Concaténation et nettoyage du corpus.    Cette partie de concaténation et nettoyage de corpus est clé car elle va alléger notre corpus pour pouvoir l’analyser sur Itrameur.    Pour ceux qui travaillent sur Windows, un programme pour concaténer est disponible sur icampus.  Il suffit de télécharger  le Fichier + le programme concat et de les placer dans le même dossier.  Double click  pour le lancer et cela concatène les fichiers existants dans ce répertoire.     Si ce n’est pas Windows, comment faire? Sachant qu’il faut introduire une valise au début et à la fin  de chaque fichier DUMP txt et CONTEXTES txt, nous avons appris en cours cette commande.  for file in `ls utf8_1* | tr ' ' '\n' | less`; do echo "<partie=$file>" >> CORPUS_FR.txt ; cat $file >> CORPUS_FR.txt ; echo "</partie>" >> CORPUS_FR.txt ; done En utilisant cette commande la concentration se fait facilement. Pensez à vous placer d...

Itrameur - Analyse textométrique.

  Itrameur Dans cette entrée nous partagerons nos commentaires sur la prise en main de l’outil Itrameur. Nous avons intégré le corpus et vérifié que la segmentation était bien définie par les balises du corpus. les  rectangles ne se croisent pas et toutes les parties semblent y être.  Après avoir importé le corpus dans le logiciel, nous nous sommes rendus compte que l’analyse était faite mot par mot et que dans notre cas (french kiss) on avait deux mots, voire trois en espagnol. Que  faire ? La solution a été de remplacer les occurrences des mots french kiss, French Kiss, “French Kiss” “french kiss” en un seul mot : french_kiss . Même traitement pour l’espagnol et le turc    beso_con_lengua , fransız_öpücüğü. cela  a bien fonctionné.  Dans un premier temps on s’est intéressés à l’indice de fréquence  du mot dans notre corpus. On  apprend qu’il y a 255 occurrences.  Ensuite on s’est intéressé aux cooccurrences du mot. Ce tableau nous...

Minigrep

  Minigrep permet d’obtenir le contexte du mot en affichant la ligne avant et après du mot recherché .  On a décidé de créer cette entré, car nous avons rencontré quelques inconvénients pour le faire fonctionner  correctement En effet, lorsqu'on faisait tourner notre script cette erreur s’affichait.  Après avoir consulté M. Fleury.  Nous sommes parvenus à trouver une solution. Ci-dessous, un résumé  des recommandations reçues.  1. Pour que ce programme fonctionne bien dans cette configuration il faut installer une bibliothèque Perl  utilisée et nécessaire pour ce script. c'est la bibliothèque Unicode::String, Or cette bibliothèque n'était pas installée sur la machine d'où le message d'erreur que l'on voyait. Pour y  remédier il faut l’installer. Pour ceux qui ont un Mac il faut se placer dans dans le terminal et taper la commande suivante :       sudo cpan install Unicode::String sudo : pour lancer cette commande en mode A...