Notions de base - 1 Ressources sémantiques

1 Ressources sémantiques

1.1 Notions de base

• Terme. Un terme est constitué d’un mot ou d’un groupe de mots qui s’ap-

plique à un seul objet ou une idée dans un domaine donné. Un terme constitué d’un seul mot (e. g., "animal", "ordinateur") est dit terme simple ou uni-terme, alors que celui formé de plusieurs mots est appelé terme complexe ou multi-termes (e. g., "caisse d’épargne", "chemin de fer").

•Concept. Un concept, défini comme un élément de la pensée, représente une

idée abstraite. Il est la construction mentale qui représente la signification du terme et qui fait référence à l’objet. Un concept terminologique représente la signification normalisée des termes par le biais d’une définition en langue naturelle. Dans un contexte particulier, un concept est exprimé par un terme (simple ou complexe). Un seul terme, intitulé parfois "label préféré", est choisi comme étiquette du concept terminologique selon la définition des linguistes. Chaque concept a un seul terme préféré, qui est souvent le nom du concept. Par exemple, le terme "Céphalée" est préféré pour le concept "Céphalée", et les autres termes non-préférés sont "Céphalodynie", "Douleur crânienne", "Mal de tête", etc.

• Classe. Dans un langage informatique (e. g., langage objet de représentation

des connaissances), un concept peut être représenté par une classe au lieu d’un concept terminologique. La classe est une représentation partielle et orientée du concept. Un concept est représenté par un concept terminologique et/ou une classe. Le concept terminologique est associé à une définition en langue naturelle et des termes synonymes, alors que la classe est associée à l’ensemble des proprié- tés et des relations qui caractérisent le concept (Charlet et al.,2004).

Une classe peut se définir par un ensemble de caractéristiques aussi appelées pro- priétés ou attributs. Les propriétés peuvent avoir des valeurs, qui varient suivant la classe à laquelle on fait référence.

Une classe peut également être définie par l’ensemble de ses instances, autrement dit l’ensemble des objets qui sont caractérisés par cette classe. Par exemple, le "canal du Midi" est une instance de la classe Canal.

• Relation. Il existe plusieurs types de relations. La relation lexicale connecte

deux termes par un lien de type synonymie, antonymie, hyponymie, hyperonymie, ou méronymie. Par exemple, les termes "douleur crânienne" et "mal de tête", qui réfèrent au même concept ("Céphalée"), sont dits synonymes.

Les classes sont aussi reliées entre elles par des relations. La relation des classes la plus populaire est la hiérarchie de spécialisation ou de généralisation (e. g., la classe "Animal" est la classe mère de "Chat"). D’autres relations entre classes peuvent être définies en fonction des usages. Par exemple, les classes représentant

des objets spatiaux comme "Chemin" sont associées entre elles par une relation d’inclusion spatiale dite de "localisation".

1.2 Typologie des ressources

Nous présentons à ce niveau les différents types de ressources sémantiques en fonction de leur contenu.

•Terminologie. Une terminologie, dans le sens d’une ressource sémantique, est

un ensemble de termes, rigoureusement définis, qui sont spécifiques à une science, une technique, un domaine particulier de l’activité humaine (Larousse, 2016). Le but essentiel d’une terminologie est de faciliter la gestion et le partage de masses d’informations, en réduisant l’ambiguïté entre les termes d’un domaine. Dans une terminologie, des termes du domaine sont normalisés par la notion de concept. Un terme est la combinaison indissociable 1) d’une expression linguistique représen- tant un mot métier et 2) d’un concept qui représente sa signification. Comme une norme pour un domaine donné est déterminée dans une terminologie de référence, la signification de chaque terme est fixé. Ainsi, il y a une seule interprétation pos- sible pour l’utilisateur. Il existe différentes terminologies alignées aux différents objectifs de traitement de l’information : nomenclature, thésaurus, base lexicale et ontologie.

•Nomenclature. Une nomenclature est un ensemble des termes en usage dans

une science, un art, ou relatifs à un sujet donné, présentés selon une classification méthodique (Larousse, 2016). Elle représente une instance de classification (code, tableau, liste, règles d’attribution d’identité...) faisant autorité et servant de réfé- rence à une discipline donnée. Il n’y a pas d’arrangement particulier des termes ni de définition explicite ; l’objectif visé est l’exhaustivité. Les concepts d’un domaine sont décrits dans une nomenclature de manière complète sans se restreindre à un objectif spécifique. Un exemple d’une nomenclature importante dans le domaine médical est la Nomenclature Systématique des Médecines Humaine et Vétérinaire (Systematized Nomenclature of Medicine - SNOMED). La SNOMED est une nomenclature pluri-axiale couvrant tous les champs de la médecine et de la dentisterie humaines, ainsi que de la médecine vétérinaire. Dans chaque axe, les concepts sont représentés par une série de termes au sein de laquelle on peut distinguer une formulation préférée et des synonymes de diverses natures syntaxiques. La Figure 2.1 (extrait du SNOMED CT Browser1) illustre l’information du concept "Solar degeneration" avec ses termes synonymes comme "Farmer’s skin" ou "Sun damaged skin".

Figure 2.1 – Exemple du concept "Solar degeneration" dans SNOMED.

•Thésaurus. Un thésaurus forme un répertoire alphabétique de termes norma-

lisés pour l’analyse de contenu, le classement et donc l’indexation de documents d’information. Il aide à la normalisation des mots-clés utilisés dans un système de RI. Ainsi la liste de mots-clés qui représentent le contenu documentaire est construite par des experts (linguistes, documentalistes) à partir des descripteurs dans un thésaurus.

Un thésaurus est constitué d’une structuration hiérarchisée de termes désignant les concepts. Les termes y sont organisés de manière conceptuelle et reliés entre eux par des relations lexicales. Il normalise son vocabulaire pour être cohérent : chaque concept terminologique a un seul terme descripteur et plusieurs termes non descripteurs, et un terme descripteur ne doit être associé qu’à un seul concept. Pour un concept, les termes non descripteurs renvoient aux descripteurs par une relation d’équivalence. On peut trouver dans un thésaurus des informations sur des termes descripteurs (la définition) et ses relations ("synonyme de", "relié à") à d’autres termes. Un thé- saurus peut fournir aussi les informations comme "des termes plus spécifiques", "des termes plus larges", ou des "termes connexes". A titre d’exemple, le thésau-

rus biomédical MeSH (Medical Subject Heading2

) est utilisé pour indexer, classer et rechercher des documents de la base MEDLINE (PubMed)3

. La Figure2.2illustre un exemple sur les informations du concept "Headache" telles que "MeSH Hea- ding" (terme descripteur), "Entry Terms" (termes non descripteur ou termes préfé- rés), "Tree Number" (code du concept dans la hiérarchie). La Figure2.3présente un extrait de la hiérarchie arborescente dans MeSH.

Figure 2.2 – Exemple de l’information sur le concept "Headache" dans MeSH.

•Base lexicale. L’organisation d’une base lexicale ressemble à celle du thésau-

rus. Les termes sont regroupés par un concept terminologique qui est connecté aux autres concepts par des relations lexicales. L’objectif d’une base lexicale est de distinguer tous les sens possibles qu’un terme peut prendre dans un texte et non de sélectionner le sens le plus commun dans un domaine d’étude. WordNet (Miller, 1995) est une base lexicale (initialement en anglais) très utilisée en TALN et RI du fait de sa couverture quasi-totale de la langue anglaise. WordNet couvre la majo- rité des noms, verbes, adjectifs et adverbes structurés en un réseau de nœuds et de liens (Fellbaum,1998). Les noms, verbes, adjectifs et adverbes sont regroupés par synonyme, appelés synsets qui expriment un concept terminologique distinct. Chaque synset représente un sens unique d’un mot particulier. La relation de base entre les termes d’un même synset est la synonymie. Les synsets sont reliés entre eux par des relations lexicales : l’hyperonymie/hyponymie, la méronymie, l’antonymie, etc.

2. https://www.nlm.nih.gov/mesh/ 3. https://www.ncbi.nlm.nih.gov/pubmed/

Figure 2.3 – Extrait de la hiérarchie MeSH pour le concept "Headache".

•Ontologie. En philosophie, l’ontologie est une étude de l’être en tant qu’être,

indépendamment de ses déterminations particulières. En informatique, ce terme est repris dans les années 90, par la première définition : "une ontologie est une spécification d’une conceptualisation" (Gruber,1993). Ainsi, une ontologie est une description des concepts et des relations qui existent pour un objet ou un ensemble d’objets. L’objectif principal d’une ontologie, comme celui d’une terminologie en général, est de partager et de réutiliser des connaissances d’un domaine donné. Dans une ontologie, un concept est représenté par une classe avec des attributs (ou propriétés). Une classe est peuplée par des instances, qui sont des objets, entités ou événements réels. Ces instances sont reliées par des relations entre eux.

Le développement du Web de données (Linked Open Data) facilite la création et la valorisation des ontologies. La ressource DBpedia (Auer et al., 2007) est une base de connaissance récemment utilisée dans les communauté Web Sémantique, Ingé- nierie de Connaissance ainsi que Recherche d’Information. Elle contient une ontologie interdomaine qui a été créée manuellement à partir des infoboxes les plus utilisées dans Wikipedia. L’ontologie couvre actuellement 685 classes qui forment une hiérarchie de subsomption et sont décrites par 2 795 propriétés différentes. L’ontologie de DBpedia contient actuellement environ 4 233 000 instances. La Fi- gure2.4illustre une partie de la hiérarchie des classes dans l’ontologie de DBpedia. Un exemple d’une ontologie importante dans le domaine médical est l’ontologie de gènes (GO - Gene Ontology) qui est une ressource terminologique destinée à structurer la description des gènes et des produits géniques dans le cadre d’une ontologie commune à toutes les espèces. La base GO est conçue comme un graphe

Figure 2.4 – Extrait de la hiérarchie des classes dans DBpedia.

orienté acyclique, chaque terme étant en relation avec un ou plusieurs termes du même domaine, et parfois d’autres domaines.

2 Méthodes de RI basées sur l’utilisation des res-

Dans le document Modèles neuronaux pour la recherche d'information : approches dirigées par les ressources sémantiques (Page 33-38)