Это не официальный сайт wikipedia.org 01.01.2023

Признаковое описание — Википедия

Признаковое описание

Признаковое описание объекта (англ. feature vector) — это вектор, который составлен из значений, соответствующих некоторому набору признаков для данного объекта. Значения признаков могут быть различного, не обязательно числового, типа. Является одним из самых распространённых в машинном обучении способов ввода данных.

Формальное определениеПравить

Обозначим через X множество объектов, ситуаций, прецедентов некоторой предметной области. Например, в задачах машинного обучения, встречающихся в медицине, прецедентами могут являться пациенты, в сфере кредитования при проведении кредитного скоринга — заёмщики, в задаче фильтрации спама — отдельные сообщения.

Признак (англ. feature) — результат измерения некоторой характеристики объекта, то есть отображение:

f : X D f  ,

где D f   — множество допустимых значений признака.

Значениями признаков могут быть тексты, графы, оцифрованные изображения, числовые последовательности, записи базы данных и т. п. В зависимости от множества D f   признаки делятся на следующие типы:

  • бинарный признак: D f = { 0 , 1 }  ;
  • номинальный признак: D f   — конечное множество;
  • порядковый признак: D f   — конечное упорядоченное множество;
  • количественный признак: D f   — множество действительных чисел.

Часто встречаются прикладные задачи с разнотипными признаками, для решения которых подходят далеко не все методы.

Если заданы признаки f 1 , , f n  , то вектор x = ( f 1 ( x ) , , f n ( x ) )   называется признаковым описанием объекта x X  .

В машинном обучении признаковые описания допустимо отождествлять с самими объектами, то есть: X = D f 1 × D f 2 × × D f n  . При этом множество X   называют признаковым пространством.

Матрицей объектов-признаков (матрица информации, матрица исходных данных) называется совокупность признаковых описаний объектов обучающей выборки X l = ( x 1 , x 2 , , x l )   длины l  , записанная в виде матрицы размера l × n   ( l   строк, n   столбцов). Столбцы этой матрицы соответствуют признакам f 1 , , f n  , а каждая строка является признаковым описаниям одного обучающего объекта. Такой вид представления является принятым в задачах классификации и регрессионного анализа, и большое число методов обучения подразумевает такое представление данных.

В приложенияхПравить

Встречающиеся на практике задачи могут не содержать удобных для математической обработки данных. Например, в задаче фильтрации спама объекты — сообщения — представлены текстами произвольной длины, могут содержать вложения различных форматов, и т. п. Для приведения данных к стандартному виду применяется процедура — извлечение признаков (англ. feature extraction) из данных или генерация признаков (англ. feature generation). Таким образом, в качестве признака можно брать и любое отображение из множества X   в множество значений, удобное для обработки. Ничто не мешает в качестве такого отображения взять некоторый алгоритм классификации (или регрессии), что позволяет получать сложные композиции алгоритмов.

ЛитератураПравить

  • Айвазян С. А., Енюков И. С., Мешалкин Л. Д. Прикладная статистика: основы моделирования и первичная обработка данных. — М.: Финансы и статистика, 1983. — 471 с.
  • Журавлев Ю. И., Рязанов В. В., Сенько О. В. Распознавание. Математические методы. Программная система. Практические применения. — М.: Фазис, 2006.
  • Загоруйко Н. Г. Прикладные методы анализа данных и знаний. — Новосибирск: ИМ СО РАН, 1999. — ISBN 5-86134-060-9.
  • Hastie T., Tibshirani R., Friedman J. The elements of statistical learning: Data Mining, Inference, and Prediction. — Springer, 2001. — 533 p. — ISBN 9780387952840.

СсылкиПравить