猜猜这组 - Demens Deum

在这篇文章中，我将描述如何使用 fasttext 文本分类器。

快速文本–用于文本分类的机器学习库。让我们试着教她通过歌曲的标题来识别金属乐队。为此，我们使用数据集进行监督学习。

让我们创建一个包含团体名称的歌曲数据集：

__label__metallica fuel
__label__metallica escape
__label__black_sabbath gypsy
__label__black_sabbath snowblind
__label__black_sabbath am i going insane
__label__anthrax anthrax
__label__anthrax i'm alive
__label__anthrax antisocial
[и т.д.]

Формат обучающей выборки:

Обучим fasttext и сохраним модель:
model.save_model("model.bin")


加载经过训练的模型并要求通过歌曲名称来识别组：

predictResult = model.predict("Bleed")
print(predictResult)
В результате мы получим список классов на которые похож данный пример, с указанием уровня похожести цифрой, в нашем случае похожесть названия песни Bleed на одну из групп датасета.

Для того чтобы модель fasttext умела работать с датасетом выходящим за границы обучающей выборки, используют режим autotune с использованием файла валидации (файл тест). Во время автотюна fasttext подбирает оптимальные гиперпараметры модели, проводя валидацию результата на выборке из тест файла. Время автотюна ограничивается пользователем в самостоятельно, с помощью передачи аргумента autotuneDuration.

Пример создания модели с использованием файла тест:


Источники
https://fasttext.cc

https://gosha20777.github.io/tutorial/2018/04/12/fasttext-for-windows
Исходный код
https://gitlab.com/demensdeum/MachineLearning/-/tree/master/6bandClassifier
					
	
	


	
		Posted bydemensdeumDecember 1, 2020December 16, 2024Posted inTechie, TutorialsTags:fasttext, machine learning	


			
						
							

			
			
				
					Published by demensdeum				
			


			
								
					View all posts by demensdeum

Источники

Исходный код

Published by demensdeum

Leave a Comment