Вопрос:

Представьте, что вы разрабатываете нейронную сеть для классификации новостей по темам: «спорт», «политика», «технологии». Сеть устроена следующим образом: • Текст новости преобразуется в числовой вектор признаков. • Скрытый слой состоит из 16 нейронов и полностью связан с входным слоем. • Выходной слой состоит из 3 нейронов и использует функцию softmax. • Обучение проводится с учителем (для каждой новости известна правильная тема). Оцените приведённые утверждения. 1. Для обучения такой сети достаточно только входных данных; правильные темы новостей знать необязательно. 2. После применения softmax выходные значения можно интерпретировать как вероятности принадлежности новости к каждому из трёх классов. 3. При полной связности каждый нейрон скрытого слоя получает входные данные от всех признаков. 4. Если сеть выдала значения [0,4; 0,35; 0,25], то это означает, что модель уверена в первом классе на 100%. 5. Если в обучающей выборке 60% новостей относятся к теме «спорт», то модель, которая всегда предсказывает «спорт», будет иметь точность 60%. 6. Если убрать скрытый слой, модель сохранит способность учитывать сложные нелинейные зависимости между признаками. В поле для краткого ответа запишите номера верных утверждений в порядке возрастания и без разделителей, а в поле для развернутого ответа обоснуйте каждое утверждение.

Ответ:

Решение:

Оценим каждое утверждение:

  1. Неверно. Для обучения нейронной сети с учителем необходимо знать правильные ответы (темы новостей) для каждого входного примера. Это называется обучением с учителем.
  2. Верно. Функция softmax на выходном слое преобразует выходы нейронов в вероятности, сумма которых равна 1. Эти вероятности показывают, насколько сеть уверена в принадлежности новости к каждому из классов.
  3. Верно. При полной связности (fully connected) каждый нейрон слоя получает на вход выходы всех нейронов предыдущего слоя. В данном случае, каждый из 16 нейронов скрытого слоя получает входные данные от всех признаков входного вектора.
  4. Неверно. Значения [0,4; 0,35; 0,25] представляют собой вероятности принадлежности к классам. Сеть уверена в первом классе на 40%, а не на 100%. 100% уверенности означало бы значение [1,0; 0; 0] (или аналогичное для другого класса).
  5. Верно. Если модель всегда предсказывает класс, который встречается в 60% случаев, то её точность будет равна 60%. Это базовый уровень точности (baseline), с которым можно сравнивать более сложные модели.
  6. Неверно. Скрытый слой, особенно с нелинейной функцией активации (которая здесь подразумевается, так как сеть обрабатывает тексты и должна улавливать зависимости), необходим для изучения сложных нелинейных зависимостей между признаками. Без скрытого слоя сеть будет эквивалентна простой линейной модели, которая не может улавливать такие зависимости.

Краткий ответ: 2, 3, 5