🧱 Parquet · Intermediário

Parquet Viewer

Arraste um arquivo .parquet e inspecione schema, metadados, compressão e as primeiras linhas — sem enviar nada para servidores.

parquetviewermetadataschemaapache parquetcolunar
Carregando ferramenta…

Descrição

O Parquet Viewer abre arquivos Apache Parquet e mostra o schema, os tipos de cada coluna, o número de linhas, os row groups, o codec de compressão e uma prévia das primeiras linhas. É a forma mais rápida de entender um arquivo Parquet sem subir um cluster Spark ou abrir um notebook.

A leitura acontece 100% no seu navegador: o arquivo nunca sai da sua máquina, então você pode inspecionar dados sensíveis com segurança.

Como funciona

Ao selecionar o arquivo, a ferramenta lê o rodapé (footer) do Parquet, que contém os metadados: schema, número de linhas, estatísticas por row group e o codec de compressão de cada coluna. Em seguida, ela decodifica apenas as primeiras linhas para montar a prévia — descompactando páginas com SNAPPY, GZIP, ZSTD ou BROTLI quando necessário. Nada é enviado para servidores.

Como usar

  1. Selecione o arquivo. Arraste um .parquet para a área indicada ou clique para escolher.
  2. Leia os metadados. Veja linhas, colunas, row groups, compressão e a versão do formato.
  3. Confira o schema. Analise o tipo e a repetição (obrigatório/opcional) de cada coluna.
  4. Explore a prévia. Ajuste quantas linhas exibir e inspecione os valores reais.

Por que importa

Parquet é um formato colunar: os dados ficam agrupados por coluna e comprimidos por row group, o que torna leituras analíticas muito mais rápidas e baratas que CSV. Entender o schema, a compressão e o tamanho dos row groups ajuda a diagnosticar problemas de performance em Spark, Trino, DuckDB e data lakes — por exemplo, arquivos pequenos demais (small files), tipos inesperados ou baixa taxa de compressão.

Exemplos

Arquivo de eventos comprimido

Entrada
eventos.parquet — Apache Spark, 3 row groups, codec SNAPPY
Saída
12.000.000 linhas · 8 colunas · compressão 4,2× (860 MB → 205 MB)
Schema: event_id (INT64), user_id (BYTE_ARRAY · UTF8), ts (INT64 · TIMESTAMP_MICROS), valor (DOUBLE)…

Ótimo para checar rapidamente o tamanho dos row groups e a taxa de compressão.

Perguntas frequentes

Meu arquivo Parquet é enviado para algum servidor?

Não. A leitura e a decodificação acontecem inteiramente no seu navegador. Nenhum byte do arquivo é transmitido, garantindo privacidade total.

Quais compressões são suportadas na prévia?

SNAPPY e arquivos sem compressão funcionam nativamente. GZIP, ZSTD, BROTLI e LZ4 também são suportados por meio de decodificadores carregados sob demanda. Os metadados (schema, linhas, row groups) são lidos independentemente da compressão.

Existe limite de tamanho de arquivo?

O limite prático é a memória do navegador, já que o arquivo é carregado na página. Arquivos de centenas de MB costumam funcionar; para vários GB, prefira ferramentas de linha de comando como DuckDB ou o próprio Spark.

A prévia lê o arquivo inteiro?

Não. Apenas as primeiras linhas escolhidas são decodificadas, então a prévia é rápida mesmo em arquivos grandes.

Ferramentas relacionadas

📊 Data Quality

CSV Profiler

Perfile um arquivo CSV: contagem de linhas, tipos por coluna, nulos, valores únicos e estatísticas — no navegador.

Intermediário
🔄 Conversores

CSV para JSON

Converta CSV em um array JSON online. Detecta cabeçalho, delimitador e tipos básicos automaticamente.

Fácil
🧩 JSON

JSON Formatter & Validator

Formate, valide e minifique JSON online. Detecta erros de sintaxe e indica a linha do problema — tudo no navegador.

Fácil
🔀 Validadores

Diff de Texto e JSON

Compare dois textos ou JSONs lado a lado e destaque linhas adicionadas, removidas e alteradas.

Fácil

Artigos relacionados

Livros recomendados

Receba novas ferramentas no seu e-mail

Todo mês lançamos novas ferramentas de engenharia de dados. Deixe seu e-mail e seja avisado em primeira mão.

Sem spam. Só enviamos novidades do hub — você pode cancelar quando quiser.

Comentários

Em breve: espaço para comentários da comunidade. Enquanto isso, participe pelas discussões no GitHub.