CULTIVA IA
HuggingFace Dataset Viewer API
IA Ingeniería & MLOps · Exploración y extracción de datasets
datasets-server.huggingface.co
Exploración del dataset
dair-ai/emotion
Pipeline de análisis de emociones en reseñas de e-commerce · Clasificador VoC para marcas cliente
PASO 1
Validar
→
PASO 2
Splits
→
PASO 3
Preview
→
PASO 4
Paginar
→
PASO 5
Buscar
→
PASO 6
Filtrar
→
PASO 7
Estadísticas
→
PASO 8
Parquet
Pasos 1 & 2 — Validar disponibilidad & Explorar splits
GET
/is-valid
/is-valid
⎘ copy
curl
"https://datasets-server.huggingface.co/is-valid
?dataset=dair-ai/emotion"
{
"preview"
:
true
,
"viewer"
:
true
,
"search"
:
true
,
"filter"
:
true
,
"statistics"
:
true
}
✓ Dataset disponible
Todas las funciones activas
GET
/splits
/splits
⎘ copy
curl
"https://datasets-server.huggingface.co/splits
?dataset=dair-ai/emotion"
Config
Split
Filas
Size
default
train
16,000
736 KB
default
validation
2,000
92 KB
default
test
2,000
92 KB
Pasos 3 & 4 — Preview de filas & Paginación
GET
/first-rows — Primeras filas del dataset
⎘ copy
curl
"https://datasets-server.huggingface.co/first-rows
?dataset=dair-ai/emotion
&config=default
&split=train"
{
"features"
: [
{
"name"
:
"text"
,
"dtype"
:
"string"
},
{
"name"
:
"label"
,
"dtype"
:
"ClassLabel"
}
],
"rows"
: [
{
"text"
:
"i feel like i'm slowly recovering..."
,
"label"
:
0
},
{
"text"
:
"i feel grateful for my family"
,
"label"
:
1
}
]
}
GET
/rows — Paginación con offset + length
⎘ copy
# Página 1 (filas 0-99)
curl
"https://datasets-server.huggingface.co/rows
?dataset=dair-ai/emotion&config=default
&split=train&
offset=0
&
length=100
"
# Página 2 (filas 100-199)
curl
"...&
offset=100
&
length=100
"
# Python — paginar todo el split
import
requests
BASE =
"https://datasets-server.huggingface.co"
params = {
"dataset"
:
"dair-ai/emotion"
,
"config"
:
"default"
,
"split"
:
"train"
}
offset, length =
0
,
100
while True
:
r = requests.get(f
"{BASE}/rows"
,
params={**params,
"offset"
: offset,
"length"
: length})
data = r.json()
if not
data[
"rows"
]:
break
offset += length
Pasos 5 & 6 — Búsqueda de texto & Filtrado por predicados
GET
/search — Full-text search
⎘ copy
# Buscar textos con "happy"
curl
"https://datasets-server.huggingface.co/search
?dataset=dair-ai/emotion&config=default
&split=train&
query=happy
&offset=0&length=10"
# Buscar "angry customer"
curl
"...&
query=angry+customer
"
Resultados para query="happy"
FILA 143
"i feel so happy today, everything went perfectly"
JOY
FILA 891
"surprisingly happy with this purchase, exceeded expectations"
SURPRISE
FILA 2047
"not happy at all, product broke after 2 days"
ANGER
GET
/filter — Filtrado con predicados SQL
⎘ copy
# Filtrar solo etiqueta ANGER (label=3)
curl
"https://datasets-server.huggingface.co/filter
?dataset=dair-ai/emotion&config=default
&split=train
&
where=label%3D3
&
orderby=text%20ASC
&offset=0&length=50"
# Filtrar JOY (label=1) y ordenar
curl
"...&
where=label%3D1
&
orderby=text
"
Mapa de etiquetas (ClassLabel)
0
SADNESS
1
JOY
2
LOVE
3
ANGER
4
FEAR
5
SURPRISE
Paso 7 — Estadísticas de columnas
GET
/statistics — Distribución de clases
/statistics
curl
"https://datasets-server.huggingface.co/statistics
?dataset=dair-ai/emotion
&config=default&split=train"
Distribución de etiquetas — split: train (16,000 filas)
sadness
4,666
29.2%
joy
5,362
33.5%
love
1,304
8.2%
anger
2,159
13.5%
fear
1,937
12.1%
surprise
572
3.6%
GET
/size — Totales del dataset
/size
curl
"https://datasets-server.huggingface.co/size
?dataset=dair-ai/emotion"
Total filas (todos los splits)
20,000
Bytes en disco
~920 KB
Columnas
2 (text, label)
Config activa
default
Idioma
en (inglés)
Licencia
Apache-2.0
✓ Dataset balanceado para entrenamiento de clasificadores de emoción en textos cortos. Ideal para VoC e-commerce.
Paso 8 — Descarga Parquet
GET
/parquet — Links de shards para descarga masiva
/parquet
⎘ copy
curl
"https://datasets-server.huggingface.co/parquet
?dataset=dair-ai/emotion"
# Python — descargar parquet directo
import
pandas
as
pd
url =
"https://huggingface.co/datasets/
dair-ai/emotion/resolve/refs%2Fconvert%2Fparquet/
default/train/0000.parquet"
df = pd.read_parquet(url)
print
(df.head())
Shards disponibles
📦
default/train/0000.parquet
Split: train · Config: default
736 KB
📦
default/validation/0000.parquet
Split: validation · Config: default
92 KB
📦
default/test/0000.parquet
Split: test · Config: default
92 KB
Resumen del pipeline — dataset listo para VoC
20K
Ejemplos totales
6
Clases de emoción
8
Endpoints API usados
3
Splits (train/val/test)
920KB
Tamaño total parquet
0€
Coste de acceso API