<?xml version="1.0" encoding="UTF-8"?>
<TEI change="metopes_publication#openedition"
     xmlns="http://www.tei-c.org/ns/1.0"
     xmlns:xsi="http://www.w3.org/2001/XMLSchema-instance"
     xmlns:xs="http://www.w3.org/2001/XMLSchema"
     xmlns:xlink="http://www.w3.org/1999/xlink"
     xmlns:xi="http://www.w3.org/2001/XInclude"
     xmlns:ns="http://www.tei-c.org/ns/1.0"
     xmlns:mathml="http://www.w3.org/1998/Math/MathML"
     xmlns:loext="urn:org:documentfoundation:names:experimental:office:xmlns:loext:1.0"
     xmlns:dcr="http://www.isocat.org/ns/dcr">
  <teiHeader>
    <fileDesc>
      <titleStmt>
        <title type="main">L’IA et la fouille de textes à l’INIST : l’IA à
        portée de tous ?</title>

        <author role="aut"><name>Pascal Cuxac</name><affiliation><ref
        target="#aff01" type="affiliation"/></affiliation><idno
        type="IDREF">165835257</idno><idno
        type="ORCID">0000000268095654</idno><idno
        type="HAL">pascal-cuxac</idno><idno
        type="ISNI">0000000432720627</idno><idno
        type="VIAF">http://viaf.org/viaf/280873820</idno></author>
      </titleStmt>

      <editionStmt>
        <edition><date>2022-10-05T19:59:00</date></edition>
      </editionStmt>

      <publicationStmt>
        <publisher/>

        <ab type="papier"><dimensions>
            <dim type="pagination">18-19</dim>
          </dimensions><date>01/10/2022</date></ab>

        <idno type="book"/>

        <ab type="lodel"><date/></ab>
      </publicationStmt>

      <sourceDesc>
        <p>Version Métopes : 3.0</p>

        <p>Written by OpenOffice</p>

        <bibl>Arabesques</bibl>
      </sourceDesc>
    </fileDesc>

    <encodingDesc>
      <tagsDecl>
        <rendition scheme="css" xml:id="none">color:black;</rendition>
      </tagsDecl>
    </encodingDesc>

    <profileDesc>
      <langUsage>
        <language ident="fr-FR"/>
      </langUsage>

      <textClass/>
    </profileDesc>

    <revisionDesc>
      <change when="2022-10-12T17:32:00"
      who="Marie-Pierre Roux">Révision</change>
    </revisionDesc>
  </teiHeader>

  <text xml:id="text">
    <front>
      <titlePage>
        <docTitle>
          <titlePart style="T_3_Article" type="main">L’IA et la fouille de
          textes à l’INIST : l’IA à portée de tous ?</titlePart>
        </docTitle>

        <docAuthor style="txt_auteur">Pascal Cuxac</docAuthor>

        <byline style="auteur_Courriel"><email><ref
        target="mailto:pascal.cuxac@cnrs.fr">pascal.cuxac@cnrs.fr</ref></email></byline>

        <byline style="auteur_Institution"><affiliation
        xml:id="aff01">Responsable du Service Text &amp; Data Mining,
        Inist-CNRS</affiliation></byline>
      </titlePage>

      <argument>
        <p style="txt_chapo">L’Inist a pour objectif de développer des outils
        de fouille de textes intégrables dans des chaînes de production mais
        également utilisables par tous les acteurs travaillant avec des
        publications numériques.</p>
      </argument>
    </front>

    <body>
      <div type="chapitre" xml:id="mainDiv">
        <p style="txt_Normal">Si la fouille de textes a toujours été présente
        à l’Inist<note n="1" place="foot" style="txt_Note" type="standard"
        xml:id="ftn1"><p> <ref target="https://www.inist.fr"><hi
        rend="underline"
        style="typo_souligne">https://www.inist.fr</hi></ref></p></note>, ce
        n’est qu’avec le lancement du projet Istex<note n="2" place="foot"
        style="txt_Note" type="standard" xml:id="ftn2"><p> <ref
        target="https://www.istex.fr"><hi rend="underline"
        style="typo_souligne">https://www.istex.fr</hi></ref></p></note><hi
        rend="bold" style="typo_gras"> </hi>que des méthodes d’intelligence
        artificielle vont être développées<hi rend="bold" style="typo_gras">
        </hi>pour être appliquées en grandeur nature sur de gros volumes de
        données, dans un processus industrialisé.</p>

        <p style="txt_Normal">Initié en 2012 par le MESR dans le cadre du
        Programme d’investissements d’avenir<note n="3" place="foot"
        style="txt_Note" type="standard" xml:id="ftn3"><p> <ref
        target="https://franceuniversites.fr/wp-content/uploads/2012/04/Projet_Istex.pdf"><hi
        rend="underline"
        style="typo_souligne">https://franceuniversites.fr/wp-content/uploads/2012/04/Projet_Istex.pdf</hi></ref></p></note>,
        Istex comprend dès le début un volet « enrichissement » <hi
        rend="italic" style="typo_Italique">via </hi>des méthodes de fouille
        de textes. Alors que l’IA n’était pas encore un mot-clé passé dans le
        langage commun, l’équipe Istex-RD d’alors commence à développer des
        méthodes d’enrichissement de données à partir notamment de techniques
        d’apprentissage automatique (<hi rend="italic"
        style="typo_Italique">machine learning </hi>ou ML), afin de déterminer
        automatiquement le domaine scientifique des articles. D’autres
        méthodes, comme l’extraction de mots clés ou d’entités nommées vont
        également voir le jour sous forme de modules intégrés à la chaîne de
        production, permettant le traitement des corpus au fur et à mesure de
        leur intégration<note n="4" place="foot" style="txt_Note"
        type="standard" xml:id="ftn4"><p> Cuxac P., Thouvenin N. (2017) :
        Archives numériques et fouille de textes : le projet Istex. Atelier
        TextMine, conférence EGC, 24 janvier 2017, Grenoble,
        France.</p></note>.</p>

        <p style="txt_Normal">À travers quatre axes de travail (structuration
        des documents, indexation automatique, reconnaissance d’entités
        nommées, catégorisation des documents) nous avons alors répondu aux
        trois principaux défis rencontrés :</p>

        <list type="unordered">
          <item style="txt_Liste_1">Mise au point et intégration d’outils de
          TDM : entraînement, adaptation, mise en production.</item>

          <item style="txt_Liste_1">Passage à l’échelle : 25 millions de
          documents à traiter.</item>

          <item style="txt_Liste_1">Reversement des données : modélisation des
          données, réintégration, mise à disposition.</item>
        </list>

        <p style="txt_Normal">Si cette approche a donné de bons résultats,
        elle a montré un certain nombre de limites : développer et mettre en
        place un nouveau traitement est un processus complexe à mettre en
        œuvre, et surtout cela rend très difficile l’utilisation de ces
        programmes en dehors de la chaîne Istex.</p>

        <div type="section1">
          <head style="T_1" subtype="level1">D’une ia intégrée dans un
          processus défini à une ia indépendante des données</head>

          <p style="txt_Normal">Dans une démarche « science ouverte », on
          constate la mise en ligne croissante, <hi rend="italic"
          style="typo_Italique">via </hi>GitHub ou GitBucket, de programmes
          permettant de traiter des données. Mais si tout un chacun a accès à
          ces algorithmes, leur mise en œuvre souvent complexe n’incite pas
          les non informaticiens à les utiliser. Nous nous inscrivons bien
          dans ce mouvement, en publiant tous nos codes, cependant nous
          voulons aller plus loin en faisant en sorte que qui que ce soit
          puisse les utiliser, quelles que soient ses compétences. Cela doit
          répondre aux demandes d’utilisateurs, documentalistes ou chercheurs,
          qui souhaitent pouvoir utiliser ces programmes sur leurs propres
          données de façon simple, et en pouvant choisir eux-mêmes les
          traitements dont ils ont besoin.</p>

          <p style="txt_Normal">Nous avons fait le choix de créer et déployer
          des applications d’IA sous forme de web services (WS), intégrables
          dans une chaîne de production comme Istex, mais également
          directement utilisables par tout utilisateur désirant traiter ses
          propres corpus. Ainsi nous passons d’une IA intégrée dans un
          processus défini à une IA indépendante des données, avec des
          contraintes minimales, utilisable par des non spécialistes, et
          largement extensible pour répondre à de nouveaux besoins.</p>

          <p style="txt_Normal">Les méthodes implémentées peuvent être
          complexes, mettant en œuvre des réseaux neuronaux élaborés, avec un
          nombre élevé de paramètres à optimiser. Afin de faciliter au maximum
          leur usage, les web services doivent répondre à un certain nombre
          d’exigences :</p>

          <list type="unordered">
            <item style="txt_Liste_1">Chaque service ne doit répondre qu’à un
            seul besoin.</item>

            <item style="txt_Liste_1">Il n’y a pas de paramétrage par
            l’utilisateur.</item>

            <item style="txt_Liste_1">Il doit y avoir un seul format
            d’entrée/sortie très simple (ex : un JSON
            identifiant/valeur).</item>

            <item style="txt_Liste_">Ils doivent être utilisables <hi
            rend="italic" style="typo_Italique">via </hi>une interface
            graphique (dans l’outil de visualisation Lodex<note n="5"
            place="foot" style="txt_Note" type="standard" xml:id="ftn5"><p>
            <ref target="https://www.inist.fr/projets/lodex"><hi
            rend="underline"
            style="typo_souligne">https://www.inist.fr/projets/lodex</hi></ref></p></note>)</item>
          </list>

          <p style="txt_Normal">Les modèles de ML sont construits par des
          spécialistes TDM, avec l’aide d’experts pour la constitution des
          corpus d’apprentissage et la validation des algorithmes, puis
          utilisés par les WS mis à disposition : l’IA devient alors
          accessible à tous et facilement applicable aux données
          bibliographiques, que ce soit sous forme de métadonnées ou de texte
          intégral<note n="6" place="foot" style="txt_Note" type="standard"
          xml:id="ftn6"><p> <hi rend="bold" style="typo_gras">Bonvallot V.,
          Parmentier F., Bourguignon L., Clauss I. and Gregorio S. (2022) : Le
          TDM pour tous grâce à des web services au sein de LODEX, outil libre
          de visualisation, </hi><hi rend="bold" style="typo_gras"><hi
          rend="italic" style="typo_Italique">Revue des Nouvelles Technologies
          de l’Information, Extraction et Gestion des Connaissances,
          </hi></hi><hi rend="bold" style="typo_gras">RNTI-E-38, 2022, 445-452
          https://editions-rnti.fr/render_pdf.php?p=1002758</hi></p></note>.
          Pour aider l’utilisateur, le site Internet objectif-TDM<note n="7"
          place="foot" style="txt_Note" type="standard" xml:id="ftn7"><p> <ref
          target="https://objectif-tdm.inist.fr"><hi rend="underline"
          style="typo_souligne">https://objectif-tdm.inist.fr</hi></ref></p></note><hi
          rend="bold" style="typo_gras"> </hi>recense les services en
          production : il permet à la fois d’identifier le service
          correspondant à ses besoins, de connaître son URL et d’avoir une
          aide sur son utilisation. À partir de là, le service est utilisable
          suivant les compétences de chacun : <hi rend="italic"
          style="typo_Italique">via </hi>une interface graphique dans Lodex
          (outil <hi rend="italic" style="typo_Italique">open source </hi>de
          visualisation de données structurées<note n="8" place="foot"
          style="txt_Note" type="standard" xml:id="ftn8"><p> <hi rend="bold"
          style="typo_gras">Gregorio, S., A. Collignon, F. Parmentier, and
          Thouvenin N. (2019) : LODEX : des données structurées au web
          sémantique </hi><ref
          target="https://hal.archives-ouvertes.fr/hal-01990444"><hi
          rend="underline"
          style="typo_souligne">https://hal.archives-ouvertes.fr/hal-01990444</hi></ref><hi
          rend="bold" style="typo_gras">. </hi><hi rend="bold"
          style="typo_gras"><hi rend="italic" style="typo_Italique">Atelier
          Web des Données Conférence EGC, </hi></hi><hi rend="bold"
          style="typo_gras">2019, Metz, France.</hi></p></note>), en ligne de
          commande, ou intégré dans un programme informatique.</p>

          <p style="txt_Normal">Les nouveaux services proposés permettent
          l’utilisation de méthodes apportant une forte valeur ajoutée aux
          données traitées sans qu’il soit nécessaire de mobiliser des
          compétences en informatique, ou en <hi rend="italic"
          style="typo_Italique">data mining. </hi>Le système est suffisamment
          souple pour rapidement mettre en production de nouveaux services
          répondants à de nouveaux besoins ou à des données ayant des
          caractéristiques propres. En effet, les nouvelles approches font
          appel à des modèles de langage, modèles statistiques capables par
          exemple, à partir de la distribution de séquences de mots, de
          deviner une succession de mots. Avec le développement des approches
          neuronales (et le <hi rend="italic" style="typo_Italique">deep
          learning</hi>), on trouve d’importantes ressources pré-entrainées
          sur de gros volumes de données et dans des langues différentes. Ces
          gros modèles « génériques » peuvent avoir un intérêt mais peuvent
          aussi entraîner des biais importants<note n="9" place="foot"
          style="txt_Note" type="standard" xml:id="ftn9"><p> <hi rend="bold"
          style="typo_gras">Bender E.M., Gebru T., McMillan-Major A., and
          Shmitchell S. (2021) : On the Dangers of Stochastic Parrots: Can
          Language Models Be Too Big? In Proceedings of the </hi><hi
          rend="bold" style="typo_gras"><hi rend="italic"
          style="typo_Italique">2021 ACM Conference on Fairness,
          Accountability, and Transparency (FAccT ‘21). </hi></hi><hi
          rend="bold" style="typo_gras">Association for Computing Machinery,
          New York, NY, USA, 610–623.</hi></p></note> ; nous l’avons constaté,
          par exemple, dans le cas d’analyses de publications de la fin XIX<hi
          rend="sup" style="typo_Exposant">e</hi> siècle au début XX<hi
          rend="sup" style="typo_Exposant">e</hi> en français, où le style est
          fondamentalement différent de celui de nos jours. C’est le cas
          également dans le cas de corpus scientifiques spécialisés où le
          vocabulaire scientifique est très mal appréhendé <hi rend="italic"
          style="typo_Italique">via </hi>des modèles génériques. Pour faire
          face à ces cas-là, nous devons pouvoir nous adapter en créant nos
          propres modèles, adaptés aux données à traiter.</p>

          <p style="txt_Normal">À l’Inist-CNRS, nous avons mis en place un
          environnement approprié facilitant le déploiement de ces services à
          partir d’algorithmes d’IA (plus spécifiquement de TDM). Cela permet
          une grande souplesse quant à la modification, l’adaptation ou la
          création de web services.</p>

          <p style="txt_Normal">Cette nouvelle offre de service est donc là
          pour répondre à de multiples finalités et s’adresse à tous les
          professionnels de l’IST qui ont besoin, par exemple, de détecter des
          thématiques scientifiques, de classer des documents, ou encore de
          les enrichir pour faire de la bibliométrie. Elle propose des
          services assez génériques pour être utiles au plus grand nombre,
          mais est également capable de s’adapter aux besoins exprimés, et
          ainsi d’évoluer continuellement pour répondre à de nouveaux
          usages.</p>
        </div>
      </div>
    </body>
  </text>
</TEI>
