Cheat Sheet

Text Analytics Toolbox 入門

さまざまな文書タイプから潜在的な情報を抽出するセマンティック テキスト マイニングのプロセス

Text Analytics Toolbox™ は、テキストデータの前処理、解析、およびモデル化のためのアルゴリズムと可視化機能を提供します。ツールボックスで作成されたモデルは、感情分析、予知保全、トピックモデリングなどの用途に使用できます。

関数名 説明
wordcloud bag of words または LDA モデルからワード クラウド チャートを作成
wordCloudCounts ワードクラウド作成のための単語数をカウント
textscatter テキストの 2D 散布図
textscatter3 テキストの 3D 散布図
heatmap ヒートマップチャートを作成
histcounts ヒストグラムのビンのカウント数
discretize データをビンまたはカテゴリにグループ化
ワードクラウド

可視化

ワードクラウドとテキスト散布図を使用して、結果を要約および検証します。

教師なし学習

モデル化と予測

bag of words や事前学習済みの単語埋め込みモデルを使用してテキストを数値表現に変換し、予測およびトピックモデリングに特化した機械学習アルゴリズムを適用します。

関数名 説明
readWordEmbedding テキストファイルから単語埋め込みを読み込む
trainWordEmbedding 単語埋め込みを学習
word2vec/vec2word 埋め込みベクトルに単語をマッピング
ldaModel 潜在的ディリクレ配分 (LDA) モデル
lsaModel 潜在意味解析 (LSA) モデル
bagOfWords bag of words モデル
fitlda 潜在的ディリクレ配分 (LDA) モデルを当てはめる
fitlsa 潜在意味解析 (LSA) モデルを当てはめる
predict 文書の主要な LDA トピックを予測
fitdist 確率分布オブジェクトをデータに当てはめる
fitrlinear 線形回帰モデルを高次元データに当てはめる
fitclinear 線形分類モデルを高次元データに当てはめる
fitcecoc 分類器向けにマルチクラスモデルを当てはめる
関数名 説明
extractFileText PDF、Microsoft Word、プレーンテキストから読み込む
textscan テキストファイルまたは文字列から書式付きデータを読み込む
readtable ファイルから table を作成
compose データを書式付き string 配列に変換
xlsread Microsoft Excel スプレッドシート ファイルを読み込む
webread RESTful Web サービスからコンテンツを読み込む
TabularTextDatastore 表形式テキストファイルのデータストア
FileDatastore カスタム ファイル リーダーを使用するデータストア
SpreadsheetDatastore スプレッドシート ファイルのデータストア
PDF、テキストファイル、およびスプレッドシートのアイコン

インポート

Microsoft® Word® ファイル、PDF、テキストファイル、およびスプレッドシートからテキストを抽出します。

テキストの前処理

前処理

よく使われる単語、句読点、および URL などのあまり役に立たないアーティファクトを削除し、単語を語幹へとステミングするテキスト正規化を適用します。

関数名 説明
tokenizedDocument 文書を単語のコレクションに分割
normalizeWords Porter ステマーを使用して単語から語形変化による語尾を削除
bagOfWords bag of words モデル
stopWords ストップワードリスト
context 文書内に出現する単語をコンテキストで検索
removeWords 文書または bag of words から特定の単語を削除
removeLongWords 文書または bag of words から長い単語を削除
removeShortWords 文書または bag of words から短い単語を削除
removeInfrequentWords bag of words モデルからカウント数の少ない単語を削除
erasePunctuation テキストおよび文書から句読点を削除
関数名 説明
str = "Hello, world" string 変数を宣言
str = ["Hello","World"] string 配列を宣言
str = string(C) 文字ベクトル C を string 型に変換
str2double string 型を double 型の数値に変換
strlength 文字列の長さを返す
isstring 入力が string 配列かどうかを判別
join 文字列を結合
split string 配列内の文字列を分割
splitlines 文字列を改行文字の位置で分割
replace string 配列の部分文字列を検索および置換
contains パターンが文字列内にあるかどうかを判別
erase 文字列内の部分文字列を削除
extractBetween インジケーターの間にある部分文字列を抽出
extractAfter 指定された位置より後の部分文字列を抽出
extractBefore 指定された位置より前の部分文字列を抽出
strcmp 文字列を比較
regexp 正規表現で照合 (大文字小文字を区別)
"Hello,world"

String

テキストデータを効率的に操作、比較、および保存できます。