Skip to content
Last updated

メモリ使用量とデータセットサイズ

Gluon Trainノートブックのメモリ使用量は、主にデータセットのサイズ(レコード数(行)とカラム数)によって影響を受けます。

トレーニング用のインスタンスを選択する際、ユーザーはこれらの次元を考慮し、適切なメモリサイズを割り当てる必要があります。

さまざまなデータセットに対するメモリサイズの要件をユーザーが把握しやすくするため、このページでは、特定のデータセット内のレコード数とカラム数に対応するサンプルメモリ使用量を参考として提供します。

前提条件

レコード数を変化させた場合のメモリ使用量

1億レコードを含むような大きなテーブルを入力として指定すると、メモリ不足エラーが発生する可能性があります。このような場合、Gluon Trainノートブック内の_sampling_threshold_パラメータを設定することを推奨します。

Treasure Data AutoMLはデフォルトで_sampling_threshold_に10Mを使用しており、通常はそれで十分です。トレーニングにデータセット全体を使用する必要はないかもしれません。

レコード数(百万)カラム数メモリ使用量(GiB)
13927.7
1039122.3
2039135.3
3039199.8
4039266.5
5039338.3

カラム数を変化させた場合のメモリ使用量

レコード数(百万)カラム数メモリ使用量(GiB)
5020206
5039338.3