<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Parquet on Xainome Blog</title><link>https://xainome-blog.beeskynohito.workers.dev/tags/parquet/</link><description>Recent content in Parquet on Xainome Blog</description><generator>Hugo</generator><language>ja</language><lastBuildDate>Tue, 07 Nov 2023 00:00:00 +0000</lastBuildDate><atom:link href="https://xainome-blog.beeskynohito.workers.dev/tags/parquet/index.xml" rel="self" type="application/rss+xml"/><item><title>parquetファイルの中身はVSCODEの拡張機能 Data Wranglerで見れる！</title><link>https://xainome-blog.beeskynohito.workers.dev/posts/2023/11/parquet-vscode-data-wrangler/</link><pubDate>Tue, 07 Nov 2023 00:00:00 +0000</pubDate><guid>https://xainome-blog.beeskynohito.workers.dev/posts/2023/11/parquet-vscode-data-wrangler/</guid><description>&lt;h2 id="parquetファイルについて">parquetファイルについて&lt;/h2>
&lt;p>parquetファイルは非常に優秀なファイルだと思います。&lt;/p>
&lt;p>pythonでデータを扱う場合、小規模のデータであればcsvファイルが使われがちですが、私の現場ではparquetファイルが使われています。&lt;/p>
&lt;h3 id="parquetのメリット">parquetのメリット&lt;/h3>
&lt;p>メリットとしては&lt;/p>
&lt;ul>
&lt;li>
&lt;p>データが圧縮されるため、ストレージの節約になる&lt;/p>
&lt;/li>
&lt;li>
&lt;p>ファイルを読み込む際、型の指定をしなくても自動で読み込んでくれる&lt;/p>
&lt;/li>
&lt;li>
&lt;p>データを列で読み込むと高速で読み込める&lt;/p>
&lt;/li>
&lt;/ul>
&lt;h3 id="parquetのデメリット">parquetのデメリット&lt;/h3>
&lt;p>デメリットとしては&lt;/p>
&lt;ul>
&lt;li>ファイルを手軽に扱えない(テキストファイルで開いたり、書き換えたり)&lt;/li>
&lt;/ul>
&lt;p>個人的にはこのように感じています。&lt;/p>
&lt;h3 id="data-wranglerについて">Data Wranglerについて&lt;/h3>
&lt;p>これが&lt;a href="https://code.visualstudio.com/docs/datascience/data-wrangler">Data Wrangler&lt;/a>(ラングラー)を使えば手軽に見ることができます！ただし、書き換えたりはできないですが…。&lt;/p>
&lt;p>しかも導入手順も簡単！&lt;/p>
&lt;ol>
&lt;li>
&lt;p>拡張機能からData Wranglerをインストール&lt;/p>
&lt;/li>
&lt;li>
&lt;p>対象のファイルを右クリック &amp;gt; Opne in Data Wranglerをクリック&lt;/p>
&lt;/li>
&lt;li>
&lt;p>pythonやjupyter notebookのカーネルに接続する&lt;/p>
&lt;/li>
&lt;li>
&lt;p>必要なライブラリが足らなければインストールを行う&lt;/p>
&lt;/li>
&lt;/ol>
&lt;p>こうすることで以下のような画面でparquetファイルの中身を見ることができます！(画面黒いと目にいいよね)&lt;/p>
&lt;p>&lt;img alt="Data Wrangler_parquet" loading="lazy" src="https://xainome-blog.beeskynohito.workers.dev/posts/2023/11/parquet-vscode-data-wrangler/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2023-11-07-224946-1024x547.png">&lt;/p>
&lt;p>csvファイルも同じように見れます&lt;/p>
&lt;p>&lt;img alt="Data Wrangler_csv" loading="lazy" src="https://xainome-blog.beeskynohito.workers.dev/posts/2023/11/parquet-vscode-data-wrangler/images/%E3%82%B9%E3%82%AF%E3%83%AA%E3%83%BC%E3%83%B3%E3%82%B7%E3%83%A7%E3%83%83%E3%83%88-2023-11-07-224915-1024x547.png">&lt;/p>
&lt;p>ちなみに上記のデータはスクレイピングで取ってきた求人情報になります(スクレイピングプログラムはChat-GPTに頼みました)。一応利用規約見てスクレイピングに関する規約はなかったので大丈夫かと思いますが、もしやる際は連続アクセスにならないよう2,3秒時間を空けることを勧めます。&lt;/p>
&lt;h3 id="データ操作について">データ操作について&lt;/h3>
&lt;p>上のカラム名の場所に欠損の数やユニークな値の数、数値であればヒストグラムの分布などが描かれたりします&lt;/p>
&lt;p>また左の操作でカラムの操作や欠損値埋め、文字列変換、グループ化など簡単なデータ変換であればこちらで操作できるうえに、コード化ファイルを出力することもできます！&lt;/p>
&lt;p>おおまかにデータを見ながら加工をし、そのプログラムを作ってくれる素晴らしい機能をMicrosoftが提供していますのでぜひ活用していきたいですね！&lt;/p></description></item></channel></rss>