SPARQLGX : Une Solution Distribuée pour RDF Traduisant SPARQL vers Spark

Damien Graux 1 Louis Jachiet 1 Pierre Genevès 1 Nabil Layaïda 1
1 TYREX - Types and Reasoning for the Web
Inria Grenoble - Rhône-Alpes, LIG - Laboratoire d'Informatique de Grenoble
Résumé : SPARQL est un langage de requête standardisé par le W3C permettant d'interroger des données exprimées au format RDF (Resource Description Framework). Avec l'augmentation des volumes de données RDF disponibles, de nombreux efforts de recherche ont été faits pour permettre l'évaluation distribuée et efficace de requêtes SPARQL. Dans ce contexte, nous proposons et partageons SPARQLGX : notre solution de stockage RDF distribuée utilisant Apache Spark pour évaluer des requêtes SPARQL et stockant les données via des infrastructures Hadoop (HDFS). SPARQLGX repose sur un traducteur de requêtes SPARQL vers une séquence d'instructions exécutables par Spark en adoptant des stratégies d'évaluation selon (1) le schéma de stockage des données utilisé et (2) des statistiques sur les données. Nous montrons que SPARQLGX permet l'évaluation de requêtes SPARQL sur plusieurs milliards de triplets RDF répartis sur plusieurs nœuds. Nous comparons aussi SPARQLGX à d'autres solutions issues de l'état-de-l'art. Nous démontrons ainsi les performances obtenues en permettant aux participants de reproduire par eux-mêmes les résultats présentés grâce à différents scénarios mettant directement en compétition plusieurs solutions de l'état-de-l'art. Nous montrons dans ce travail que tout en ayant une architecture relativement simple, SPARQLGX représente une alternative intéressante dans de nombreux cas d'utilisation.
Type de document :
Communication dans un congrès
BDA 2016 - 32ème Conférence sur la Gestion de Données - Principes, Technologies et Applications, Nov 2016, Poitiers, France. BDA2016
Liste complète des métadonnées


https://hal.inria.fr/hal-01412035
Contributeur : Tyrex Equipe <>
Soumis le : mercredi 7 décembre 2016 - 18:11:45
Dernière modification le : vendredi 16 décembre 2016 - 17:38:26
Document(s) archivé(s) le : lundi 20 mars 2017 - 22:37:41

Fichier

sparqlgx-bda2016-2pages.pdf
Fichiers produits par l'(les) auteur(s)

Identifiants

  • HAL Id : hal-01412035, version 1

Collections

Citation

Damien Graux, Louis Jachiet, Pierre Genevès, Nabil Layaïda. SPARQLGX : Une Solution Distribuée pour RDF Traduisant SPARQL vers Spark. BDA 2016 - 32ème Conférence sur la Gestion de Données - Principes, Technologies et Applications, Nov 2016, Poitiers, France. BDA2016. <hal-01412035>

Partager

Métriques

Consultations de
la notice

192

Téléchargements du document

44