Extraire automatiquement des informations dans un texte avec spaCy

Magazine
Marque
GNU/Linux Magazine
Numéro
248
Mois de parution
mai 2021
Spécialité(s)


Résumé

Les modèles récents d’apprentissage supervisé permettent d’atteindre de très bonne performance à un coût moindre dans les tâches liées au traitement de texte.


Dans cet article, nous allons présenter la librairie spaCy, qui s’est imposée dans l’écosystème des data scientists pour le NLP (Natural Language Processing). Un exemple concret d’extraction d’informations nous guidera pour la prise en main. Nous aborderons ensuite un sujet plus complexe : l’analyse des erreurs et comment la recherche d’incertitude permet d’augmenter la précision de manière substantielle ainsi que la satisfaction de l’utilisateur final, face à un système d’apprentissage supervisé.

Le sujet sera traité en langage Python et détaillé dans l’ordre suivant : définition de la tâche et première solution retenue, choix du modèle NER (Reconnaissance d’Entités Nommées), analyse des erreurs et quantification d’incertitude pour améliorer les résultats.

1. Problème et première approche

Le problème proposé est le suivant : extraire automatiquement des informations précises depuis un corpus de documents PDF non normalisé....

Cet article est réservé aux abonnés. Il vous reste 94% à découvrir.
S'abonner à Connect
  • Accédez à tous les contenus de Connect en illimité
  • Découvrez des listes de lecture et des contenus Premium
  • Consultez les nouveaux articles en avant-première
Je m'abonne


Article rédigé par

Par le(s) même(s) auteur(s)

Génération d’articles à l’aide de réseaux de neurones

Magazine
Marque
GNU/Linux Magazine
HS n°
Numéro
100
Mois de parution
janvier 2019
Spécialité(s)
Résumé

La gestion de la programmation de la methode setattribut() a l'application est alors de la memoire de l'instance de la destruction de la session par les requetes de l'application] : Est-il possible de concevoir un algorithme capable de générer votre prochain GNU/Linux Magazine ?

Les derniers articles Premiums

Les derniers articles Premium

Générez votre serveur JEE sur-mesure avec Wildfly Glow

Magazine
Marque
Contenu Premium
Spécialité(s)
Résumé

Et, si, en une ligne de commandes, on pouvait reconstruire son serveur JEE pour qu’il soit configuré, sur mesure, pour les besoins des applications qu’il embarque ? Et si on pouvait aller encore plus loin, en distribuant l’ensemble, assemblé sous la forme d’un jar exécutable ? Et si on pouvait même déployer le tout, automatiquement, sur OpenShift ? Grâce à Wildfly Glow [1], c’est possible ! Tout du moins, pour le serveur JEE open source Wildfly [2]. Démonstration dans cet article.

Bénéficiez de statistiques de fréquentations web légères et respectueuses avec Plausible Analytics

Magazine
Marque
Contenu Premium
Spécialité(s)
Résumé

Pour être visible sur le Web, un site est indispensable, cela va de soi. Mais il est impossible d’en évaluer le succès, ni celui de ses améliorations, sans établir de statistiques de fréquentation : combien de visiteurs ? Combien de pages consultées ? Quel temps passé ? Comment savoir si le nouveau design plaît réellement ? Autant de questions auxquelles Plausible se propose de répondre.

Les listes de lecture

9 article(s) - ajoutée le 01/07/2020
Vous désirez apprendre le langage Python, mais ne savez pas trop par où commencer ? Cette liste de lecture vous permettra de faire vos premiers pas en découvrant l'écosystème de Python et en écrivant de petits scripts.
11 article(s) - ajoutée le 01/07/2020
La base de tout programme effectuant une tâche un tant soit peu complexe est un algorithme, une méthode permettant de manipuler des données pour obtenir un résultat attendu. Dans cette liste, vous pourrez découvrir quelques spécimens d'algorithmes.
10 article(s) - ajoutée le 01/07/2020
À quoi bon se targuer de posséder des pétaoctets de données si l'on est incapable d'analyser ces dernières ? Cette liste vous aidera à "faire parler" vos données.
Voir les 64 listes de lecture

Abonnez-vous maintenant

et profitez de tous les contenus en illimité

Je découvre les offres

Déjà abonné ? Connectez-vous