Ce que tu vas savoir faire
- Distinguer objet, descripteur, valeur, type et collection.
- Lire un schéma et diagnostiquer une valeur manquante ou invalide.
- Interpréter correctement un fichier CSV.
- Réaliser recherche, filtre, tri et calcul sur une table.
- Croiser deux tables avec une clé commune.
- Distinguer métadonnées, synchronisation, partage et sauvegarde.
- Évaluer ouverture, caractère personnel et coût matériel d’un jeu de données.
Avant de commencer
- Savoir lire un tableau à double entrée.
- Distinguer fichier, dossier et application.
- Connaître la notion de donnée personnelle.
Le chapitre en bref
Une donnée structurée associe, selon un schéma explicite, des objets à des descripteurs et à des valeurs typées. Le format CSV peut enregistrer une table, mais il faut connaître séparateur, encodage, guillemets et valeurs manquantes. Recherche, filtre, tri, calcul et croisement répondent à des questions différentes. Métadonnées, droits, stockage, synchronisation, sauvegarde et données personnelles doivent être contrôlés avant toute réutilisation.
1. Que décrit exactement une ligne ?
Une donnée est une valeur choisie pour décrire un objet, une personne ou un événement. Dans une table, chaque ligne représente normalement un objet de la collection et chaque colonne un descripteur partagé.
Dans une collection fictive de stations, station_id identifie l’objet, commune est un texte, fréquentation un nombre et accessible un booléen. Le nom de colonne n’est pas la valeur : commune est le descripteur ; « Rivière » est une valeur.
Objet, descripteur ou valeur ?
La structure donne une place et un sens stables à chaque valeur.
2. Pourquoi le type et le schéma changent-ils le traitement ?
Le type indique les opérations possibles : additionner des nombres, ordonner des dates, comparer des textes ou tester un booléen. Le format précise comment la valeur est écrite ; l’unité précise ce qu’elle mesure.
Un schéma documente noms, types, formats, unités, contraintes et valeurs manquantes. Le code 0 ne doit pas servir automatiquement à la fois de vraie mesure et d’absence : vide, inconnu et nul sont trois états différents.
Cette cellule respecte-t-elle le schéma ?
Une valeur lisible n’est pas forcément calculable ni valide.
3. Un CSV est-il seulement un tableau avec des virgules ?
CSV est un fichier texte tabulaire : une ligne de texte par ligne de table, avec un séparateur annoncé. Virgule, point-virgule ou tabulation existent selon les producteurs et les outils.
Une valeur contenant le séparateur doit être protégée selon les conventions, souvent par des guillemets doubles. L’encodage UTF-8 évite de nombreux défauts sur les accents. Une extension .csv ne garantit ni schéma correct, ni même nombre de champs constant.
Pourquoi la ligne est-elle mal découpée ?
L’extension ne suffit pas : le dialecte du fichier doit être connu.
4. Recherche, filtre, tri et calcul répondent-ils à la même question ?
Rechercher localise un objet ou une valeur ; filtrer conserve les lignes satisfaisant un test ; trier réordonne sans retirer ; calculer produit une nouvelle valeur ou un agrégat.
Sur trois fréquentations 120, 80 et 100, . Cette fraction n’a de sens que si les lignes appartiennent au même périmètre et si l’absence n’a pas été transformée arbitrairement en zéro.
Quelle opération répond à la question ?
Le traitement se choisit depuis la sortie attendue.
5. Pourquoi séparer puis croiser deux tables ?
Une base peut séparer stations et communes. La clé commune commune_id permet de relier chaque station à la bonne commune sans recopier partout population, région ou coordonnées.
La redondance crée des anomalies : une correction doit être répétée, une insertion peut manquer d’informations et une suppression peut effacer le dernier exemplaire d’un fait. Une clé doit être stable, unique dans la table de référence et compatible entre les tables.
Sur quelle clé croiser les deux tables ?
Une jointure fiable dépend d’identifiants compatibles et contrôlés.
6. Où sont le fichier, ses métadonnées et ses copies ?
Les métadonnées décrivent le fichier ou son contenu : auteur, date, format, taille, coordonnées ou licence selon le cas. Elles ne sont pas nécessairement visibles dans la table et peuvent être ajoutées par un appareil ou une personne.
Le cloud désigne des ressources distantes, pas une sauvegarde automatique. La synchronisation répercute souvent modifications et suppressions ; le partage règle des accès ; une sauvegarde indépendante conserve une version restaurable. Teste la restauration au lieu de supposer qu’une copie existe.
Que se passe-t-il après une suppression ?
Une restauration testée prouve la sauvegarde ; le mot cloud ne la prouve pas.
7. Accessible signifie-t-il ouvert, anonyme et sans coût ?
Un jeu de données ouvertes doit avoir un producteur, une licence, une date, un périmètre, un schéma et des conditions de réutilisation compréhensibles. Une donnée personnelle reste personnelle si une personne est identifiable, même après remplacement du nom par un identifiant réversible.
La minimisation impose de ne collecter que ce qui est nécessaire à la finalité. Stockage, calcul, réseau et refroidissement consomment aussi des ressources : l’AIE et l’ADEME estiment la consommation électrique mondiale des centres de données à environ 415 TWh en 2024, soit près de 1,5 % de l’électricité mondiale. C’est un ordre de grandeur daté, pas le coût fixe d’un fichier.
Peut-on réutiliser ce jeu tel quel ?
Accessible ne signifie ni ouvert, ni anonyme, ni sans coût matériel.
Erreurs fréquentes
L'essentiel à mémoriser
- Objets décrits.
- Schéma contrôlé.
- CSV décodé.
- Traitements choisis.
- Tables croisées.
- Copies distinguées.
- Impacts contextualisés.
Vérifier sa compréhension
Réponds aux 8 questions. Ton score et les réponses justes ou fausses apparaissent immédiatement.
Réviser au bon moment
Révèle chaque réponse, puis indique la difficulté de ton rappel pour programmer la prochaine révision dans ce navigateur.
Objet / descripteur / valeur ?
Ligne / colonne / cellule dans une table simple.
Prochaine révision : à programmer
Schéma ?
Noms, types, formats, unités, contraintes et valeurs manquantes.
Prochaine révision : à programmer
Contrôles CSV ?
Séparateur, guillemets, encodage, en-tête et champs.
Prochaine révision : à programmer
Recherche / filtre / tri ?
Localise / sélectionne / réordonne.
Prochaine révision : à programmer
Clé de croisement ?
Descripteur stable et compatible reliant les lignes.
Prochaine révision : à programmer
Synchronisation / sauvegarde ?
Réplique l’état / conserve une version restaurable indépendante.
Prochaine révision : à programmer
Poursuivre le parcours
- Avant Comment un réseau social organise-t-il les relations, les contenus et les risques ?
- Tu es ici Comment une table devient-elle une information fiable ?
- Ensuite Comment un téléphone transforme-t-il des signaux en position, carte et itinéraire ? Disponible avec l'accès complet
Sources et traçabilité
Dernière vérification : 2026-08-09
- Programme de sciences numériques et technologie de seconde, Ministère de l’Éducation nationale — consulté le 2026-08-09.
- Programmes et ressources en SNT - voie GT, Éduscol — consulté le 2026-08-09.
- Ouvrir des données, Guides de data.gouv.fr — consulté le 2026-08-09.
- Maîtriser les schémas de données, Guides de data.gouv.fr — consulté le 2026-08-09.
- Identifier les données personnelles, CNIL — consulté le 2026-08-09.
- Minimisation, CNIL — consulté le 2026-08-09.
- Energy demand from AI - Energy and AI, Agence internationale de l’énergie — consulté le 2026-08-09.
- Centres de données numériques : perspectives d’évolution de leurs consommations, ADEME — consulté le 2026-08-09.