Registrar la fuente, la fecha de referencia y las unidades al recopilar datos públicos
En lugar de recopilar solo un título y una URL, registra en una sola fila la fecha de referencia, la fecha de publicación, la fecha de acceso, las unidades y las condiciones de uso. Incluye una plantilla CSV y una lista de comprobación que no requieren código.
Contenido revisado 2026.09.19Incluye archivos de ejemplo
Ver el índice
La traducción se ha realizado con IA. Comprueba el código, las unidades y los valores junto con el original. La revisión por hablantes nativos de cada idioma aún no se ha completado. English
Para quién esPrincipiantes que buscan y organizan por sí mismos datos públicos para informes, estudios de mercado o trabajos académicos
Preparación
Prepara un editor de hojas de cálculo que pueda abrir archivos CSV y un navegador web. No se requiere Python.
Extrae el ZIP descargado y comprueba source_ledger.csv, README.txt y CHECKLIST.txt.
Los 3 records incluidos son datos ficticios de demostración y no contienen estadísticas reales.
01Registrar los datos para poder encontrarlos de nuevo
Cuando encuentres data para utilizar en un report, registra una row en ese momento. Mantener juntos data title, provider y detail URL te permite volver a abrir los mismos data más adelante. Antes de copiar numbers, escribe también qué describen los data, a qué fecha corresponden y en qué unit están expresados.
source_ledger.csv en este artículo es una table para registrar el context de los data. No tiene ninguna función para recopilar numbers automáticamente ni para juzgar si los data están current. No se realizaron crawling, API calls ni account connections reales.
02Distinguir tres fechas y las unidades
Elemento
Significado
Ejemplo o regla de escritura
reference_date
La fecha de referencia que describen los data
2026-03-31 (fictional example)
published_date
El día en que se publicaron los data
2026-04-10 (fictional example)
checked_date
El día en que realmente abriste y comprobaste la source
Blank hasta que la abras
unit
La unidad en que se cuentan o miden los values
Tal como aparece en la source, como items, people, cases, KRW o thousand KRW
No supongas que la modified date de un portal es la misma que la reference date de los data. Si los data cubren un period, como datos monthly o annual, añade las start and end dates y si son cumulative a scope_definition. Si no se muestra ninguna reference date, no sustituyas por today's date; déjala como pendiente de confirmación.
03La función de cada una de las 14 columnas
Grupo de columnas
CSV columns
Qué registrar
Record type
record_id, data_kind
Unique ID y si los data son fictional o real
Source
source_title, publisher, source_url
Original title, provider y detail URL
Dates
reference_date, published_date, checked_date
Reference date, publication date, actual access date
Interpretation
unit, scope_definition
Unit, target, region y counting definition
Terms of use
license_url, license_note
Dónde están los terms of use de los data y qué se comprobó
Progress
verification_status, follow_up
Check status y el siguiente elemento que debe comprobarse
En source_url, coloca la detail page de los data en lugar de una search result address. En license_url, registra dónde confirmaste los terms que realmente se aplican. Si descargaste un file, escribe también el file name y la version en scope_definition o follow_up.
04Registrar un elemento con la plantilla
Extrae el ZIP y copia source_ledger.csv para crear un working file. Conserva el original template.
En la importación del CSV, elige UTF-8 e importa las columns de ID, date y URL como text. Este file no guarda column widths ni colors.
Después de comprobar las 3 fictional example rows, añade una row para real data. Elige un record_id que no se solape, como R001, y establece data_kind como real data.
Abre tú mismo la source para confirmar title y provider y copia la detail URL. Después escribe reference date, publication date, actual access date, unit y counting scope.
Comprueba el permitted scope of use y la required attribution de los data y regístralos en license_url y license_note. La usage policy del Korean Public Data Portal y la KOGL license type guide están enlazadas en las official references de abajo.
Deja los unknown items en blank y escribe el check status y qué comprobar después. Guarda el working file como un CSV UTF-8 con otro nombre y vuelve a abrirlo para comprobarlo.
La data detail screen del Korean Public Data Portal muestra items como provider, modified date y permitted scope of use. Puedes utilizar la actual detail page de los reference documents para practicar la lectura de esos item names por separado. Esa page no es la source de los fictional examples.
05Qué representan los ejemplos incluidos
ID
Datos ficticios
Principales elementos en blanco
Estado de comprobación
EX001
Facilities in fictional region A
Source URL, access date, terms-of-use URL
Source not checked
EX002
Received requests in fictional region B
Common unchecked items + reference date
Reference date needs checking
EX003
Usage in fictional region C
Common unchecked items + unit
Unit needs checking
Ninguna de las 3 example rows está marcada como record check complete. Un blank no significa 0 ni not applicable; significa que no pudo comprobarse. No se creó ninguna column para real statistics, por lo que los examples no pueden citarse como evidence de numbers.
El result final no es un automatic report, sino una source list que permite volver a encontrar la source y seguir los check items restantes.
06Lista de comprobación antes de usar datos en un informe
Abre tú mismo la URL y comprueba que corresponda a los mismos data que el title y provider registrados.
Comprueba que reference date, publication date y actual access date estén cada una en la column correcta.
Comprueba que no hayas comparado como un mismo value units o scopes diferentes, como people y cases, KRW y thousand KRW, o monthly y cumulative.
Revisa si comprobaste los terms of use y attribution requirements de los data.
Comprueba que los unique IDs no se solapen y que los fictional demonstration data no se hayan mezclado con lo que realmente citas.
Cambia a record check complete únicamente las rows en las que realmente hayas revisado source URL, las tres dates, unit, definition y terms of use. Si algún item no puede comprobarse, conserva otro status.
CHECKLIST.txt en la descarga contiene el mismo check procedure y recommended status values. record check complete es un work status; no garantiza la accuracy o currency de los data ni permission para todos los purposes of use.
07Errores comunes al registrar
Problema
Cómo corregirlo
La source tiene únicamente el portal name
Mantén juntos original title, provider y detail URL.
La reference date fue sobrescrita con la access date
Restaura la reference date al momento que describen los data y coloca la actual access date en checked_date.
Solo se muestra una modified date, pero se registró como publication date
No adivines published_date; escribe en follow_up que solo se comprobó la modified date.
Thousand KRW se copió como KRW
Conserva la original unit y, si hace falta conversion, conserva calculation evidence por separado.
Los blanks se rellenaron con 0
Representa los values que no pudiste comprobar con blank y un needs-checking status.
Las dates y el Korean text del CSV cambiaron
En la importación, elige UTF-8 y text columns, después guarda y vuelve a abrir.
08Límites de una lista manual
Un CSV no tiene automatic input validation ni change history. Escribir un status value no realiza la comprobación.
No detecta automáticamente changes, withdrawals ni moved links. Vuelve a comprobar la source cuando la utilices.
Incluso con la misma unit y reference date, pueden diferir survey target o counting definition. Evalúa comparability por separado después de leer la original description.
Este artículo explica una forma de registrar sources. No recopiló ni verificó real statistics ni realizó individual legal judgments sobre terms of use.
Registro de ejecución y verificación
La estructura de la plantilla se comprobó con las bibliotecas estándar csv, json y datetime en CPython 3.12.14 sobre Windows 11 (10.0.26200). Los usuarios pueden editar el CSV sin Python.
Se comprobaron 14 CSV columns, 3 fictional records, unique IDs y date formats
Se comprobaron los fictional data labels, URLs y access dates en blanco por no estar verificados y que los statuses correspondan a los missing items
Se comprobó que file names y column names coincidan entre README, checklist y article
Se comprobaron en la web la official usage policy, license type guide y metadata screen links
Límites de la verificación
No se realizaron crawling, account connections, API calls ni data downloads reales.
No se verificaron real statistics, la validez a largo plazo de los links ni cómo muestra el CSV la aplicación Excel.
El código de ejemplo, los nombres de archivo y las claves de entrada se mantienen como en el original. Consulta también los comandos y los pasos de comprobación del texto traducido.
Material de práctica original · Guarda los archivos originales por separado antes de ejecutarlo.
Fuentes de referencia
Las explicaciones y los ejemplos son de elaboración propia. Puedes consultar los comportamientos y conceptos relacionados en las siguientes fuentes oficiales.
Separa los ID duplicados de las respuestas vacías en 10 respuestas sintéticas. Indica el denominador de respuestas válidas y guarda en un archivo nuevo los recuentos y porcentajes por opción, además de los motivos de exclusión.
Mantén una pequeña lista de referencias de investigación en CSV, normaliza el texto DOI para compararlo y genera un archivo de revisión para valores DOI duplicados o ausentes. El workflow conserva el CSV original y no afirma que un DOI sea válido solo porque esté presente.
Documenta qué significa cada columna del conjunto de datos antes del análisis, incluida su unidad, tipo de dato y valores permitidos. Un pequeño conjunto de datos sintético muestra cómo el mismo diccionario también puede servir para una validación automática sencilla.