Skip to content
>_ TrueFileSize.com

Sample Parquet File Download — Free Apache Parquet for Testing

Download free Apache Parquet example files from 100KB to 50MB — Snappy, GZIP, and uncompressed variants. These Parquet test files are built for data engineers and analysts working with Spark, Pandas, BigQuery, Athena, DuckDB, and Snowflake. Use them as parquet files for testing data lake ingestion, ETL pipelines, and columnar query performance.

sample-100kb.parquet

101 KB

1,100 rows · SNAPPY

File details and verification
Filename
sample-100kb.parquet
Exact size
103,223 bytes
Displayed size
101 KB
Catalog status
Valid catalog fixture
SHA-256
233a2f1b5d5b59aef7b7082cca701bf85740d8f6bb0b9567f39cb60beff98dd9
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
1,100
Columns
6
Codec
SNAPPY
Note
simple-flat
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-100kb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-500kb.parquet

508 KB

3,300 rows · SNAPPY

File details and verification
Filename
sample-500kb.parquet
Exact size
520,156 bytes
Displayed size
508 KB
Catalog status
Valid catalog fixture
SHA-256
9ba44fc83ee20f4b818eaa3a88a74a37616dbcb6ee614359c8a643ad35803024
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
3,300
Columns
10
Codec
SNAPPY
Note
nested-schema
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-500kb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-1mb.parquet

1.06 MB

5,000 rows · GZIP

File details and verification
Filename
sample-1mb.parquet
Exact size
1,107,028 bytes
Displayed size
1.06 MB
Catalog status
Valid catalog fixture
SHA-256
d688597090a38e8666256e4db34fb677b24616a7b44e19e9873b02b02629be4f
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
5,000
Columns
12
Codec
GZIP
Note
with-nulls
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-1mb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-5mb.parquet

5.15 MB

22,000 rows · SNAPPY

File details and verification
Filename
sample-5mb.parquet
Exact size
5,396,990 bytes
Displayed size
5.15 MB
Catalog status
Valid catalog fixture
SHA-256
e1bfb167a8381f610ba337902f098abceb29dfe0ae7de26eb42503b8035ddb7e
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
22,000
Columns
15
Codec
SNAPPY
Note
large-columns
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-5mb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-10mb.parquet

10.28 MB

44,000 rows · SNAPPY

File details and verification
Filename
sample-10mb.parquet
Exact size
10,784,249 bytes
Displayed size
10.28 MB
Catalog status
Valid catalog fixture
SHA-256
44890c3142829fde6be7e6ffd4f7865202651248b83715e1364e7dea9c92c55e
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
44,000
Columns
15
Codec
SNAPPY
Note
production-like
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-10mb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-50mb.parquet

52.95 MB

150,000 rows · SNAPPY

File details and verification
Filename
sample-50mb.parquet
Exact size
55,526,471 bytes
Displayed size
52.95 MB
Catalog status
Valid catalog fixture
SHA-256
9520de6bfef868cfff49cf086eb20706f9e3973ef85eb0b6a875da7375c25587
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
150,000
Columns
20
Codec
SNAPPY
Note
stress-test
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-50mb.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-uncompressed.parquet

199 KB

2,000 rows · NONE

File details and verification
Filename
sample-uncompressed.parquet
Exact size
203,702 bytes
Displayed size
199 KB
Catalog status
Valid catalog fixture
SHA-256
c74a4a3778c4c7133cfa5410729796d6920a2dd2a3843b112ef70798d695691e
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
2,000
Columns
8
Codec
NONE
Note
uncompressed
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-uncompressed.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

sample-gzip.parquet

299 KB

3,000 rows · GZIP

File details and verification
Filename
sample-gzip.parquet
Exact size
306,421 bytes
Displayed size
299 KB
Catalog status
Valid catalog fixture
SHA-256
33cc93c6a6e4a946429692ce4dd78ddf0b59516e8576c394ebc12367f65da727
Header signature
Matched (PAR1)
Verified on
2026-08-10
MIME type
application/octet-stream
Rows
3,000
Columns
8
Codec
GZIP
Note
gzip-compressed
License
CC0 / Public Domain
Download URL
https://cdn.truefilesize.com/parquet/sample-gzip.parquet

See how TrueFileSize generates and measures sample files, or review the editorial policy.

Use cases for sample Parquet files

  • Testing Parquet readers (pyarrow, DuckDB, Spark, pandas)
  • Benchmarking Parquet vs CSV read performance
  • Testing data lake ingestion pipelines (S3, GCS, ADLS)
  • Verifying Parquet schema evolution and compatibility
  • Testing BI tool Parquet import (Tableau, Power BI, Metabase)
  • Validating Snappy vs GZIP compression handling

Parquet vs CSV vs JSON for analytics

FeatureParquetCSVJSON
Storage layoutColumnarRow-basedRow-based
File size (1M rows)~50 MB~200 MB~400 MB
Column pruningYes (read only needed cols)No (read all)No (read all)
Schema enforcementYes (typed columns)No (all strings)Partial
Predicate pushdownYes (row group stats)NoNo
Human readableNo (binary)YesYes
Best forAnalytics, data lakes, MLData exchange, importsAPIs, configs

How to read and write Parquet files

# Python (pandas + pyarrow — most common)
import pandas as pd
df = pd.read_parquet('data.parquet')
df.to_parquet('output.parquet', engine='pyarrow')

# Python (polars — faster alternative)
import polars as pl
df = pl.read_parquet('data.parquet')

# DuckDB (SQL on Parquet — zero copy)
duckdb.sql("SELECT * FROM 'data.parquet' WHERE age > 30")
duckdb.sql("COPY (SELECT * FROM my_table) TO 'out.parquet'")

# Apache Spark
df = spark.read.parquet("s3://bucket/data.parquet")

# CLI inspection (parquet-tools / pqrs)
parquet-tools schema data.parquet
parquet-tools head data.parquet
pqrs schema data.parquet

Parquet compression codecs

CodecRatioSpeedWhen to use
SnappyGoodVery fastDefault — best balance (Spark, DuckDB)
GZIPBestSlowLong-term storage, bandwidth-limited
ZSTDBestFastModern alternative to GZIP (Spark 3+)
None1:1FastestTesting, already-compressed data

Technical specifications

Full nameApache Parquet
Extension.parquet
TypeColumnar binary storage format
Magic bytesPAR1 (header and footer)
CompressionSnappy (default), GZIP, ZSTD, LZ4, Brotli, None
EncodingDictionary, RLE, Delta, Bit-packing
Nested typesDremel-style repetition/definition levels
Developed byTwitter + Cloudera (2013), Apache project

Frequently Asked Questions

What is Apache Parquet?
Apache Parquet is an open-source columnar storage format designed for efficient analytics on large datasets. Unlike CSV (row-based), Parquet stores data column by column — enabling column pruning, better compression (4-10x smaller than CSV), and predicate pushdown. It's the default format for data lakes on S3/GCS/ADLS, used by Spark, BigQuery, Athena, Snowflake, and every major analytics platform.
Parquet vs CSV — Which is better for data?
Parquet is dramatically better for analytics: (1) 4-10x smaller files via columnar compression. (2) Column pruning — read only the columns you need. (3) Predicate pushdown — skip irrelevant row groups using min/max stats. (4) Schema enforcement — typed columns prevent data errors. CSV is better for human readability and simple data exchange. A 10GB CSV becomes ~1GB Parquet with 10-100x faster query performance.
Parquet vs Avro — What is the difference?
Parquet is columnar (optimized for read-heavy analytics — SELECT specific columns). Avro is row-based (optimized for write-heavy streaming and full-record access). Use Parquet for data warehouses, BI tools, and ad-hoc queries. Use Avro for Kafka event streams, data ingestion, and schema evolution. Many pipelines use Avro for ingestion → convert to Parquet for analytics.
How to read Parquet file?
Python: pd.read_parquet('data.parquet') or polars.read_parquet('data.parquet'). SQL: DuckDB — SELECT * FROM 'data.parquet'. Spark: spark.read.parquet('s3://bucket/data.parquet'). CLI: parquet-tools head data.parquet or pqrs schema data.parquet. Cloud: BigQuery, Athena, and Snowflake query Parquet directly from S3/GCS.
Parquet compression types — Snappy vs GZIP vs ZSTD?
Snappy (default): fastest decompression (5-10x faster than GZIP), ~20% larger files. Best for interactive queries in Spark/DuckDB/Presto. GZIP: best compression ratio but slowest. Best for cold storage and bandwidth-limited transfers. ZSTD: best of both worlds — near-GZIP compression with near-Snappy speed. Supported in Spark 3+, Arrow, DuckDB. Our sample files include Snappy, GZIP, and uncompressed variants.
How do I convert CSV to Parquet?
Python: pd.read_csv('data.csv').to_parquet('data.parquet', engine='pyarrow'). DuckDB: COPY (SELECT * FROM 'data.csv') TO 'data.parquet'. Spark: spark.read.csv('data.csv').write.parquet('output/'). Always specify column dtypes when converting to avoid all-string schemas in the output Parquet file.

Other data formats

Related reading