Text Analytics Toolbox 入門
Text Analytics Toolbox™ は、テキストデータの前処理、解析、およびモデル化のためのアルゴリズムと可視化機能を提供します。ツールボックスで作成されたモデルは、感情分析、予知保全、トピックモデリングなどの用途に使用できます。
| 関数名 | 説明 |
|---|---|
wordcloud |
bag of words または LDA モデルからワード クラウド チャートを作成 |
wordCloudCounts |
ワードクラウド作成のための単語数をカウント |
textscatter |
テキストの 2D 散布図 |
textscatter3 |
テキストの 3D 散布図 |
heatmap |
ヒートマップチャートを作成 |
histcounts |
ヒストグラムのビンのカウント数 |
discretize |
データをビンまたはカテゴリにグループ化 |
可視化
ワードクラウドとテキスト散布図を使用して、結果を要約および検証します。
| 関数名 | 説明 |
|---|---|
readWordEmbedding |
テキストファイルから単語埋め込みを読み込む |
trainWordEmbedding |
単語埋め込みを学習 |
word2vec/vec2word |
埋め込みベクトルに単語をマッピング |
ldaModel |
潜在的ディリクレ配分 (LDA) モデル |
lsaModel |
潜在意味解析 (LSA) モデル |
bagOfWords |
bag of words モデル |
fitlda |
潜在的ディリクレ配分 (LDA) モデルを当てはめる |
fitlsa |
潜在意味解析 (LSA) モデルを当てはめる |
predict |
文書の主要な LDA トピックを予測 |
fitdist |
確率分布オブジェクトをデータに当てはめる |
fitrlinear |
線形回帰モデルを高次元データに当てはめる |
fitclinear |
線形分類モデルを高次元データに当てはめる |
fitcecoc |
分類器向けにマルチクラスモデルを当てはめる |
| 関数名 | 説明 |
|---|---|
extractFileText |
PDF、Microsoft Word、プレーンテキストから読み込む |
textscan |
テキストファイルまたは文字列から書式付きデータを読み込む |
readtable |
ファイルから table を作成 |
compose |
データを書式付き string 配列に変換 |
xlsread |
Microsoft Excel スプレッドシート ファイルを読み込む |
webread |
RESTful Web サービスからコンテンツを読み込む |
TabularTextDatastore |
表形式テキストファイルのデータストア |
FileDatastore |
カスタム ファイル リーダーを使用するデータストア |
SpreadsheetDatastore |
スプレッドシート ファイルのデータストア |
| 関数名 | 説明 |
|---|---|
tokenizedDocument |
文書を単語のコレクションに分割 |
normalizeWords |
Porter ステマーを使用して単語から語形変化による語尾を削除 |
bagOfWords |
bag of words モデル |
stopWords |
ストップワードリスト |
context |
文書内に出現する単語をコンテキストで検索 |
removeWords |
文書または bag of words から特定の単語を削除 |
removeLongWords |
文書または bag of words から長い単語を削除 |
removeShortWords |
文書または bag of words から短い単語を削除 |
removeInfrequentWords |
bag of words モデルからカウント数の少ない単語を削除 |
erasePunctuation |
テキストおよび文書から句読点を削除 |
| 関数名 | 説明 |
|---|---|
str = "Hello, world" |
string 変数を宣言 |
str = ["Hello","World"] |
string 配列を宣言 |
str = string(C) |
文字ベクトル C を string 型に変換 |
str2double |
string 型を double 型の数値に変換 |
strlength |
文字列の長さを返す |
isstring |
入力が string 配列かどうかを判別 |
join |
文字列を結合 |
split |
string 配列内の文字列を分割 |
splitlines |
文字列を改行文字の位置で分割 |
replace |
string 配列の部分文字列を検索および置換 |
contains |
パターンが文字列内にあるかどうかを判別 |
erase |
文字列内の部分文字列を削除 |
extractBetween |
インジケーターの間にある部分文字列を抽出 |
extractAfter |
指定された位置より後の部分文字列を抽出 |
extractBefore |
指定された位置より前の部分文字列を抽出 |
strcmp |
文字列を比較 |
regexp |
正規表現で照合 (大文字小文字を区別) |