Телеграмм чат группы dlinnlp страница 23

parrot.ru

Рейтинг популярных групп и каналов

В рейтинге участвует:

групп:

каналов:

Виртуальный сервер на SSD - недорого!

Аренда выделенных и виртуальных серверов (VDS/VPS), хостинг, аренда IP-адресов, администрирование, круглосуточная поддержка

qwarta.ru подробнее

Резервное копирование с проверкой на вирусы!!!

Удобный сервис создания резервных копий на любой сервер сети интернет. Отслеживайте изменения, проверяйте на вирусы. Надежно защитите свой бизнес!

go.backupland.com

Выбираете сервер? Любая конфигурация на заказ!

Аренда физических серверов любых конфигураций под любые запросы - 1С бухгалтерия, игровые сервера, нагруженные проекты, интернет-магазины!

qwarta.ru подробнее

Size: a a a

DL in NLP

2929 membersпожаловаться на группу

1
«
…
‹
18
19
20
21
22
23
24
›
…
»

2019 August 29

OpenGPT-2: We Replicated GPT-2 Because You Can Too
ссылка

We demonstrate that many of the results of the paper can be replicated by two masters students, with no prior experience in language modeling and if you have $50K прим ред.

В статье много подробностей о подготовке датасета, на которые интересно обратить внимание (правда они теперь не такие релевантные, тк датасет от OpenAI уже доступен).

OpenGPT-2: We Replicated GPT-2 Because You Can Too

By Aaron Gokaslan* and Vanya Cohen*

источник

141519:57пожаловаться #1

2019 August 30

Третий пост серии про моё поступление

Часть 3. Студенческая виза и переезд

Все посты: Часть 1. Поcтупление Часть 2. Получение бизнес-визы и первый визит в США Часть 3. Студенческая виза и переезд Часть 4. Что нужно успеть в первые недели PhD Disclaimer: я не уверен, что смогу перечислить тут все подробности получения студенческой визы, потому что что-то из этого я уже забыл. Жизнь - боль, бывает.

источник

136911:27пожаловаться #2

A Complete List of Important Natural Language Processing Frameworks you should Know (NLP Infographic)

Инфографику по NLP завезли

www.analyticsvidhya.com/blog/2019/08/complete-list-important-frameworks-nlp

Analytics Vidhya

A Complete List of Important Natural Language Processing Frameworks you should Know (NLP Infographic)

Overview
Here's a list of the most important Natural Language Processing (NLP) frameworks you need to know in the last two years
From Google AI's Transformer to Facebook Research's XLM/mBERT, we chart the rise of NLP through the lens of these seismic breakthroughs Introduction Have you heard about the latest

источник

156219:22пожаловаться #3

Оптимизатор, использующий заметно меньше памяти. Звучит интересно, потому что ADAM потребляет памяти в два раза больше, чем сама нейросеть.
Stack more layers теперь будет ещё проще.

twitter.com/JeffDean/status/1167285750766850048

Reduced memory optimizers! From https://t.co/HHml5ESVjR: For parameters of deep networks ..., we form a cover consisting of slices of codimension one for each tensor. Thus, for an m x n parameter matrix...The memory requirements ... drop from m*n to merely m+n. https://t.co/IMqlFKjbL9

источник

290922:09пожаловаться #4

Ссылка: https://cutt.ly/qwl2hNM

google-research/google-research

Google Research. Contribute to google-research/google-research development by creating an account on GitHub.

источник

208522:09пожаловаться #5

2019 September 04

DeepBayes запостил свои материалы онлайн 🎉
https://twitter.com/deepbayes/status/1168784281965146112?s=19

за ссылку спасибо @Cookie_thief

Deep|Bayes Summer School

We have finally posted all school materials online Slides: https://t.co/Moas2Bnr3q Practical assignments: https://t.co/lCU2EmKzDM Videos: https://t.co/VauqTMR3nm

источник

179121:37пожаловаться #6

2019 September 06

Мысли гугла на тему компилятора для нейросеток

https://storage.googleapis.com/pub-tools-public-publication-data/pdf/1c082b766d8e14b54e36e37c9fc3ebbe8b4a72dd.pdf

источник

136121:32пожаловаться #7

zoning tapping fiennes everyone!

Universal Adversarial Triggers for Attacking and Analyzing NLP

Довольно простая adversarial-атака показывает, насколько современные системы неустойчивы. Ищется такая последовательность токенов, добавленная в начало (конец) текста, чтобы все примеры в датасете классифицировались конкретным классом. Или чтобы на вопрос определённого вида (Who …?) был всегда один и тот же ответ (Jeff Dean).
Советую почитать блогпост и окунуться в статью после.

how ] ] there Jeff Dean ; who who did

http://www.ericswallace.com/triggers

Universal Triggers

Universal Adversarial Triggers for Attacking and Analyzing NLP

источник

140422:33пожаловаться #8

2019 September 07

Implicit Deep Latent Variable Models for Text Generation.
Le Fang at el. University at Buffalo
arxiv.org/abs/1908.11527.pdf

iVAE. Как VAE, только лучше.

Deep latent variable models (LVM), такие как вариационные автоэнкодеры, начинают играть важную роль в генерации текста. Благодаря гладкому непрерывному латентному пространству можно интерполяцией генерировать текст (например, в контексте диалога) и выполнять векторные перобразования для перноса стиля.

Репрезентативная способность текущих LVM ограничена:
(1) предположением о нормальности распределения (posterior) латентных переменных при заданных входных данных
(2) коллапсом posterior, когда декодер становится к нему нечувствителен. Причина этого, вероятно, в неоправданности предположения (1) для конкретных данных.

Для решения данных проблем предлагается:
- iVAE (VAE from apple (нет)) инсайт статьи: вместо сильного (слишком) предположения о нормальном распределении латентных переменных используется вспомогательная нейронка (авторы называют её не иначе как многослойный перцептрон MLP), которая производит распределение латентных переменных, получая на вход ембединг входных данных из енкодера и гаусовский шум.
- iVAEMI максимизируем взаимную информацию между латентным представлением и входом, получая соответcтвие каждому предложению локальной области в латентном пространстве.

Особое великолепие заключено в репозитории, позволяющем воспроизвести все результаты статьи последовательностью скриптов на питоне, где код читается легче матана в статье.

🏆SOTA-языковое моделирование. На датасете Penn Tree Bank (PTB)
🏆SOTA-языковое моделирование. На датасете Yahoo.
🏆SOTA-языковое моделирование. На датасете Yelp corpora.
🎭 Перенос стиля - превращение негативных комментариев Yelp в позитивные (и наоборот). Добавляется сентимент-классификатор (многослойный перцептрон), енкодер и классификатор учатся состязательно, используются два различных декодера: для позитива и негатива. Примеры в статье вдохновляют достаточно, чтобы вызвать недоверие и желание воспроизвести.
💬 Генерация ответа в диалоге. Используя несущие смысловую нагрузку истории диалога латентные переменные, генерируется ответ на датасетах Switchboard и Dailydialog.

Implicit Deep Latent Variable Models for Text Generation

Deep latent variable models (LVM) such as variational auto-encoder (VAE) have
recently played an important role in text generation. One key factor is the
exploitation of smooth latent structures...

источник

149722:02пожаловаться #9

источник

133322:06пожаловаться #10

2019 September 08

Episodic Memory in Lifelong Language Learning
d’Autume et al. DeepMind
arxiv.org/abs/1906.01076

DeepMind исследуют способы борьбы с catastrophic forgetting на задачах NLP. Постановка эксперимента такая: мы берём несколько датасетов, решающих один тип задачи (например, Yelp, AGNews, DNPedia, Amazon, Yahoo) и последовательно учим каждую задачу одной сеткой в течение одной эпохи. После чего мы смотрим качество на каждой задаче. Если применять стандартный метод обучения, то сетка будет хорошо решать только самую последнюю задачу, которую она видела. Мы хотим это побороть.

Способ такой: использовать небольшой sparse experience replay + local adaptation

Sparse experience replay:
Мы записываем некоторые примеры из обучающей выборки в массив и во время обучения периодически обращаемся к ним, чтобы не забыть.

Local adaptation:
На инференсе для каждого примера, для которого нужно сделать предсказание мы выбираем несколько похожих примеров из experience replay и делаем несколько шагов оптимизации специального лосса по этим примерам.

Результаты: всё бейзлайны побиты.

источник

133222:01пожаловаться #11

источник

130022:01пожаловаться #12

2019 September 09

Четвёртый и последний пост серии про моё поступление

Часть 4. Что нужно успеть в первые недели PhD

Предыдущие посты: Часть 1. Поcтупление Часть 2. Получение бизнес-визы и первый визит в США Часть 3. Студенческая виза и переезд Совсем не было времени написать этот пост последние несколько дней. Завтра (уже сегодня) первый учебный день

источник

147111:26пожаловаться #13

2019 September 10

On Extractive and Abstractive Neural Document Summarization with Transformer Language Models
Subramanian et al. [MILA]
arxiv.org/abs/1909.03186

We present a method to produce abstractive summaries of long documents that exceed several thousand words via neural abstractive summarization. We perform a simple extractive step before generating a summary, which is then used to condition the transformer language model on relevant information before being tasked with generating a summary. We show that this extractive step significantly improves summarization results. We also show that this approach produces more abstractive summaries compared to prior work that employs a copy mechanism while still achieving higher rouge scores. Note: The abstract above was not written by the authors, it was generated by one of the models presented in this paper.

У этой статьи настолько потрясающий абстракт, что к нему просто нечего добавить. Всем читать.

источник

153319:56пожаловаться #14

источник

135919:56пожаловаться #15

2019 September 11

GPT-2 написал книгу (даже две).
И их можно купить на Amazon.
Писатели детективов напряглись.

twitter.com/gdb/status/1171538432100712448

Greg Brockman

GPT-2 is now a published author: https://t.co/9WuuKJbipd https://t.co/sQxcV9tjKX

источник

165013:50пожаловаться #16

2019 September 12

Завезли интуиции по тому, как работает батчнорм

https://twitter.com/jeremyphoward/status/1171873417731006464

Jeremy Howard

This is the best distillation of recent (and old!) research on batchnorm I've seen. There is so much to learn about training mechanics by studying this thread and the links it contains. https://t.co/a1PeCy7M1s

источник

136210:11пожаловаться #17

Релиз-кандидат TensorFlow 1.5, который будет последним из TF 1.X (в этот раз уже точно).

Фишки:
1. pip install tensorflow ставит GPU-версию (при этом она будет работать и с CPU)
1. Модуль forward-совместимости с TF2.0

Полностью читать тут:

github.com/tensorflow/tensorflow/releases/tag/v1.15.0-rc0

Release TensorFlow 1.15.0-rc0 · tensorflow/tensorflow

Release 1.15.0-rc0
This is the last 1.x release for TensorFlow. We do not expect to update the 1.x branch with features, although we will issue patch releases to fix vulnerabilities for at least on...

источник

125510:47пожаловаться #18

Моделька для контролируемой генерации текста от команды Einstein.ai
Пока не вникал в суть, но вроде бы просто языковая модель со специальными токенами во время тренировки.

twitter.com/RichardSocher/status/1171847882078470144

Richard Socher

We release the largest publicly available language model: CTRL has 1.6B parameters and can be guided by control codes for style, content, and task-specific behavior. Incredible generations! Paper https://t.co/0Wr2XiOl2V Github https://t.co/PA8GxqtS9V Blog https://t.co/Q2xQFtKQQE

источник

134911:26пожаловаться #19

Facebook AI Research заопенсорсили новую среду для обучения с подкреплением.
Основная фишка - "планирование" агентом каких-то high-level стратегий с помощью естественного языка.
Ссылка: https://ai.facebook.com/blog/-teaching-ai-to-plan-using-language-in-a-new-open-source-strategy-game/

Teaching AI to plan using language in a new open-source strategy game

Facebook AI has open sourced MiniRTSv2, a real-time strategy game designed to test and evaluate a range of AI techniques related to reinforcement learning, hierarchical decision-making and natural language processing.

источник

134321:16пожаловаться #20

1
«
…
‹
18
19
20
21
22
23
24
›
…
»