Compression et indexation de séquences annotées
Type de document :
Thèse
Titre :
Compression et indexation de séquences annotées
Titre en anglais :
Compressing and indexing labeled sequences
Auteur(s) :
Rocher, Tatiana [Auteur]
Centre de Recherche en Informatique, Signal et Automatique de Lille - UMR 9189 [CRIStAL]
Bioinformatics and Sequence Analysis [BONSAI]
Centre de Recherche en Informatique, Signal et Automatique de Lille - UMR 9189 [CRIStAL]
Bioinformatics and Sequence Analysis [BONSAI]
Directeur(s) de thèse :
Mathieu Giraud
Mikaël Salson
Mikaël Salson
Date de soutenance :
2018-02-12
Président du jury :
Lynda Tamine-Lechani [Rapporteuse]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Membre(s) du jury :
Lynda Tamine-Lechani [Rapporteuse]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Laetitia Jourdan [Examinatrice]
Guillaume Blin [Rapporteur]
Arnaud Lefebvre [Examinateur]
Organisme de délivrance :
Université de Lille
École doctorale :
ED SPI 072
Mot(s)-clé(s) :
Algorithmique du texte
Structure de données
Bioinformatique
Compression de données
Indexation de texte
Transformée de Burrows-Wheeler
Recombinaisons V(D)J
Structure de données
Bioinformatique
Compression de données
Indexation de texte
Transformée de Burrows-Wheeler
Recombinaisons V(D)J
Mot(s)-clé(s) en anglais :
V(D)J recombinations
Wavelet Tree
Burrows-Wheeler transform
Stringology
Data structure
Bioinformatics
Data compressing
Text indexing
Wavelet Tree
Burrows-Wheeler transform
Stringology
Data structure
Bioinformatics
Data compressing
Text indexing
Discipline(s) HAL :
Informatique [cs]/Bio-informatique [q-bio.QM]
Informatique [cs]/Algorithme et structure de données [cs.DS]
Sciences du Vivant [q-bio]/Immunologie/Immunité adaptative
Informatique [cs]/Algorithme et structure de données [cs.DS]
Sciences du Vivant [q-bio]/Immunologie/Immunité adaptative
Résumé :
Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison ...
Lire la suite >Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison V(D)J, un marqueur de globules blancs, où le texte est une séquence ADN et les annotations sont des noms de gènes. Le système immunitaire d'une personne se représente par un ensemble de recombinaisons V(D)J. Avec le séquençage à haut débit, on peut avoir accès à des millions de recombinaisons V(D)J qui sont stockées et doivent pouvoir être retrouvées et comparées rapidement. La première contribution de cette thèse est une méthode de compression d'un texte annoté qui repose sur le principe du stockage par références. Le texte est découpé en facteurs pointant vers les séquences annotées déjà connues. La seconde contribution propose deux index pour un texte annoté. Ils utilisent une transformée de Burrows-Wheeler indexant le texte ainsi qu'un Wavelet Tree stockant les annotations. Ces index permettent des requêtes efficaces sur le texte, les annotations ou les deux. Nous souhaitons à terme utiliser l'un de ces index pour indexer des recombinaisons V(D)J obtenues dans des services d'hématologie lors du diagnostic et du suivi de patients atteints de leucémie.Lire moins >
Lire la suite >Cette thèse en algorithmique du texte étudie la compression, l'indexation et les requêtes sur un texte annoté. Un texte annoté est un texte sur lequel nous ajoutons des informations. Ce peut être par exemple une recombinaison V(D)J, un marqueur de globules blancs, où le texte est une séquence ADN et les annotations sont des noms de gènes. Le système immunitaire d'une personne se représente par un ensemble de recombinaisons V(D)J. Avec le séquençage à haut débit, on peut avoir accès à des millions de recombinaisons V(D)J qui sont stockées et doivent pouvoir être retrouvées et comparées rapidement. La première contribution de cette thèse est une méthode de compression d'un texte annoté qui repose sur le principe du stockage par références. Le texte est découpé en facteurs pointant vers les séquences annotées déjà connues. La seconde contribution propose deux index pour un texte annoté. Ils utilisent une transformée de Burrows-Wheeler indexant le texte ainsi qu'un Wavelet Tree stockant les annotations. Ces index permettent des requêtes efficaces sur le texte, les annotations ou les deux. Nous souhaitons à terme utiliser l'un de ces index pour indexer des recombinaisons V(D)J obtenues dans des services d'hématologie lors du diagnostic et du suivi de patients atteints de leucémie.Lire moins >
Résumé en anglais : [en]
This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, ...
Lire la suite >This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, the text is a DNA sequence and the labels are the genes' names. A person's immune system can be represented with a set of V(D)J recombinations. With high-throughput sequencing, we have access to millions of V(D)J recombinations which are stored and need to be recovered and compared quickly.The first contribution of this thesis is a compression method for a labeled text which uses the concept of storage by references. The text is divided into sections which point to pre-established labeled sequences. The second contribution offers two indexes for a labeled text. Both use a Burrows-Wheeler transform to index the text and a Wavelet Tree to index the labels. These indexes allow efficient queries on text, labels or both. We would like to use one of these indexes on V(D)J recombinations which are obtained with hematology services from the diagnostic or follow-up of patients suffering from leukemia.Lire moins >
Lire la suite >This thesis in text algorithmics studies the compression, indexation and querying on a labeled text}. A labeled text is a text to which we add information. As an example, in a V(D)J recombination, a marker for lymphocytes, the text is a DNA sequence and the labels are the genes' names. A person's immune system can be represented with a set of V(D)J recombinations. With high-throughput sequencing, we have access to millions of V(D)J recombinations which are stored and need to be recovered and compared quickly.The first contribution of this thesis is a compression method for a labeled text which uses the concept of storage by references. The text is divided into sections which point to pre-established labeled sequences. The second contribution offers two indexes for a labeled text. Both use a Burrows-Wheeler transform to index the text and a Wavelet Tree to index the labels. These indexes allow efficient queries on text, labels or both. We would like to use one of these indexes on V(D)J recombinations which are obtained with hematology services from the diagnostic or follow-up of patients suffering from leukemia.Lire moins >
Langue :
Français
Collections :
Source :
Fichiers
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Accès libre
- Accéder au document
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Accès libre
- Accéder au document
- https://tel.archives-ouvertes.fr/tel-01758361/document
- Accès libre
- Accéder au document
- 2018-phd-rocher.pdf
- Accès libre
- Accéder au document
- document
- Accès libre
- Accéder au document