CULTIVA IA
HuggingFace Dataset Viewer API
IA Ingeniería & MLOps · Exploración y extracción de datasets
datasets-server.huggingface.co

Exploración del dataset dair-ai/emotion

Pipeline de análisis de emociones en reseñas de e-commerce · Clasificador VoC para marcas cliente

PASO 1
Validar
PASO 2
Splits
PASO 3
Preview
PASO 4
Paginar
PASO 5
Buscar
PASO 6
Filtrar
PASO 7
Estadísticas
PASO 8
Parquet
Pasos 1 & 2 — Validar disponibilidad & Explorar splits
GET /is-valid
/is-valid
curl "https://datasets-server.huggingface.co/is-valid
?dataset=dair-ai/emotion"
{
  "preview": true,
  "viewer": true,
  "search": true,
  "filter": true,
  "statistics": true
}
✓ Dataset disponible
Todas las funciones activas
GET /splits
/splits
curl "https://datasets-server.huggingface.co/splits
?dataset=dair-ai/emotion"
Config Split Filas Size
default train 16,000 736 KB
default validation 2,000 92 KB
default test 2,000 92 KB
Pasos 3 & 4 — Preview de filas & Paginación
GET /first-rows — Primeras filas del dataset
curl "https://datasets-server.huggingface.co/first-rows
  ?dataset=dair-ai/emotion
  &config=default
  &split=train"
{
  "features": [
    { "name": "text", "dtype": "string" },
    { "name": "label", "dtype": "ClassLabel" }
  ],
  "rows": [
    { "text": "i feel like i'm slowly recovering...", "label": 0 },
    { "text": "i feel grateful for my family", "label": 1 }
  ]
}
GET /rows — Paginación con offset + length
# Página 1 (filas 0-99)
curl "https://datasets-server.huggingface.co/rows
  ?dataset=dair-ai/emotion&config=default
  &split=train&offset=0&length=100"


# Página 2 (filas 100-199)
curl "...&offset=100&length=100"

# Python — paginar todo el split
import requests
BASE = "https://datasets-server.huggingface.co"
params = {"dataset": "dair-ai/emotion",
          "config": "default", "split": "train"}
offset, length = 0, 100
while True:
    r = requests.get(f"{BASE}/rows",
        params={**params, "offset": offset, "length": length})
    data = r.json()
    if not data["rows"]: break
    offset += length
Pasos 5 & 6 — Búsqueda de texto & Filtrado por predicados
GET /search — Full-text search
# Buscar textos con "happy"
curl "https://datasets-server.huggingface.co/search
  ?dataset=dair-ai/emotion&config=default
  &split=train&query=happy
  &offset=0&length=10"


# Buscar "angry customer"
curl "...&query=angry+customer"
Resultados para query="happy"
FILA 143
"i feel so happy today, everything went perfectly" JOY
FILA 891
"surprisingly happy with this purchase, exceeded expectations" SURPRISE
FILA 2047
"not happy at all, product broke after 2 days" ANGER
GET /filter — Filtrado con predicados SQL
# Filtrar solo etiqueta ANGER (label=3)
curl "https://datasets-server.huggingface.co/filter
  ?dataset=dair-ai/emotion&config=default
  &split=train
  &where=label%3D3
  &orderby=text%20ASC
  &offset=0&length=50"


# Filtrar JOY (label=1) y ordenar
curl "...&where=label%3D1&orderby=text"
Mapa de etiquetas (ClassLabel)
0 SADNESS
1 JOY
2 LOVE
3 ANGER
4 FEAR
5 SURPRISE
Paso 7 — Estadísticas de columnas
GET /statistics — Distribución de clases
/statistics
curl "https://datasets-server.huggingface.co/statistics
  ?dataset=dair-ai/emotion
  &config=default&split=train"
Distribución de etiquetas — split: train (16,000 filas)
sadness
4,666
29.2%
joy
5,362
33.5%
love
1,304
8.2%
anger
2,159
13.5%
fear
1,937
12.1%
surprise
572
3.6%
GET /size — Totales del dataset
/size
curl "https://datasets-server.huggingface.co/size
  ?dataset=dair-ai/emotion"
Total filas (todos los splits)
20,000
Bytes en disco
~920 KB
Columnas
2 (text, label)
Config activa
default
Idioma
en (inglés)
Licencia
Apache-2.0
✓ Dataset balanceado para entrenamiento de clasificadores de emoción en textos cortos. Ideal para VoC e-commerce.
Paso 8 — Descarga Parquet
GET /parquet — Links de shards para descarga masiva
/parquet
curl "https://datasets-server.huggingface.co/parquet
  ?dataset=dair-ai/emotion"


# Python — descargar parquet directo
import pandas as pd
url = "https://huggingface.co/datasets/
  dair-ai/emotion/resolve/refs%2Fconvert%2Fparquet/
  default/train/0000.parquet"

df = pd.read_parquet(url)
print(df.head())
Shards disponibles
📦
default/train/0000.parquet
Split: train · Config: default
736 KB
📦
default/validation/0000.parquet
Split: validation · Config: default
92 KB
📦
default/test/0000.parquet
Split: test · Config: default
92 KB
Resumen del pipeline — dataset listo para VoC
20K
Ejemplos totales
6
Clases de emoción
8
Endpoints API usados
3
Splits (train/val/test)
920KB
Tamaño total parquet
0€
Coste de acceso API