Huggingface TransformersでBERTをFine Tuningしてみる TL;DR 様々な自然言語処理モデルをお手軽に使えるHuggingface Transformersを利用し、日本語の事前学習済みBERTモデルのFine Tuningを試してみました。
Notion評価レポート TL;DR 個人の情報管理ツールとしてNotionを使ってみた際の評価レポートです。チームでの利用ではなく、あくまで個人の情報管理の範囲かつ無料プランで使ってみた感想です。
直近はMarkdown形式のテキストファイルをDropboxで管理していましたが、その代替としては十分に機能するという結論です。データベースとしての機能はパーソナルデータベースとしては使いやすいと思いますが、現状では正式なAPIが提供されておらず、CSVで出力して他に利用するしかないため、おまけ程度に考えるのがいいと思います。
背景 この手の情報管理ツールとしては、過去にOneNoteやEvernote、古くはWindowsのTaskPrizeなんて使っていましたが、最近はDropboxでテキストファイル(Markdown形式)で記録していました。Notionにはデータベースの機能があり、Board表示やTimeline(ガントチャート表示)が有るため、リーディングリスト(WebClip含む)、タスク管理、パスワード管理なども可能です。それぞれ以下を利用していました。
PyCaretで学ぶデータ分析におけるAutoMLの利用 TL;DR ボストン住宅価格データセットを利用して、データ分析におけるAutoMLの利用を解説します。 似たようなコンテンツは他にも色々有りますが、手動でのデータ分析からAutoMLの利用までの一連の流れを説明する機会があったので、その内容を纏めています。 以下のような流れでの解説です。
SageMakerで利用できるDeepChemのためDockerfile TL;DR SageMakerでトレーニングのために使用できるDeepChem用のDockerfileです。 バージョン依存にするため、取り急ぎ以下のバージョン専用です。
deepchem-2.3.0 python-3.6 tensorflow-1.14.0 Dockerfileにより独自コンテナでSageMaker上でトレーニングする方法はSageMakerで独自コンテナでトレーニングする方法を参照してください。
SageMakerで独自コンテナでトレーニングする方法 TL;DR AWS SageMakerで独自コンテナでトレーニングする方法です。 メトリクスの設定などを含めて必要最小限の設定でトレーニングするためのサンプルとなります。 ローカルモードとSageMaker上のトレーニングジョブとしての実行もフラグの切替で可能となっています。
自然言語処理で使われるAttentionのWeightを可視化する(spaCy版) TL;DR 自然言語処理で使われるAtentionのAttention Weight(Attention Weightを加味した入力シーケンス毎の出力)を可視化します。 基本的に自然言語処理で使われるAttentionのWeightを可視化すると同様ですが、spaCyを利用したバージョンです。
LightGBMをOptunaでパラメータチューニングする TL;DR LightGBMのパラメータをOptunaのLightGBM Tunerでチューニングします。 OptunaのLightGBM TunerはOptunaに組み込まれているLightGBM用のパラメータチューナーです。
AWS DeepLens Tips TL;DR AWS DeepLensがやっと届いたので動かしてました。 挙動を掴むまで結構ハマったので、注意点とか確認方法などのTipsを纏めてみました。
BERTおよびWord2Vecで文の類似性を確認する TL;DR 文の類似性を確認する方法としてBERTとWord2Vecを比較します。 文全体の類似性ではなくトークン単位での比較です。
BERTとWord2Vecによるベクトル化にはtext-vectorianを使用します。
XGBoostをOptunaでパラメータチューニングする TL;DR XGBoostのパラメータをOptunaでチューニングします。 ベンチマーク用データとしてはボストン住宅価格データセットを使用します。
データ準備 scikit-learnのdatasetsを使ってデータをロードします。 学習データとテストデータの分割は8:2です。