{
  "id": 434691,
  "title": "Anyone used competition metric as objective function?",
  "url": "/competitions/asl-fingerspelling/discussion/434691",
  "author_name": "Dieter",
  "post_date": "2023-08-26T06:26:12.148000",
  "votes": 7,
  "comment_count": 2,
  "views": 0,
  "content": "<p>Anyone made any other loss function than CrossEntropy or CTC work? We looked at MWER loss, smoothed edit distance loss but saw no benefit for our model. I worked through list of papers found under <a href=\"https://github.com/1ytic/edit-distance-papers\" target=\"_blank\">https://github.com/1ytic/edit-distance-papers</a></p>\n<table>\n<thead>\n<tr>\n<th>Year</th>\n<th>Task</th>\n<th>Reward level</th>\n<th>Algorithms, Models</th>\n<th>Affiliation</th>\n<th>Authors, Link</th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td>2020</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, RNN-T</td>\n<td>Amazon</td>\n<td><a href=\"https://arxiv.org/abs/2007.13802\" target=\"_blank\">Guo et al.</a></td>\n</tr>\n<tr>\n<td>2020</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>MGS, parameter search</td>\n<td>NYU</td>\n<td><a href=\"https://arxiv.org/abs/2006.03158\" target=\"_blank\">Welleck, Cho</a></td>\n</tr>\n<tr>\n<td>2020</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Proper Noun, Phonetic Fuzzing, MWER, RNN-T, LAS</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/2005.09756\" target=\"_blank\">Peyser, Sainath, Pundak</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>NLP</td>\n<td>Sentence</td>\n<td>GPT-2, PPO, Human labeling</td>\n<td>OpenAI</td>\n<td><a href=\"https://arxiv.org/abs/1909.08593\" target=\"_blank\">Ziegler, Stiennon et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Neural Architecture Search, REINFORCE, CTC</td>\n<td>KPMG Nigeria, OAU</td>\n<td><a href=\"https://arxiv.org/abs/1912.05946\" target=\"_blank\">Baruwa et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Normalized MWER</td>\n<td>Amazon</td>\n<td><a href=\"https://arxiv.org/abs/1912.03363\" target=\"_blank\">Gandhe, Rastrow</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Token</td>\n<td>MBR, RNN-T</td>\n<td>Tencent, USA</td>\n<td><a href=\"https://arxiv.org/abs/1911.12487\" target=\"_blank\">Weng et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Token</td>\n<td>ECTC-DOCD</td>\n<td>China</td>\n<td><a href=\"https://www.isca-speech.org/archive/Interspeech_2019/pdfs/1212.pdf\" target=\"_blank\">Yi, Wang, Xu</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, RNN-T, LAS</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/1908.10992\" target=\"_blank\">Sainath, Pang et al</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>MT</td>\n<td>Token</td>\n<td>Reinforce-NAT, Non-Autoregressive Transformer</td>\n<td>China, Tencent</td>\n<td><a href=\"https://arxiv.org/abs/1906.09444\" target=\"_blank\">Shao, Feng et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>MT, TS, APE</td>\n<td>Token</td>\n<td>Levenshtein Transformer, imitation learning</td>\n<td>Facebook, New York</td>\n<td><a href=\"https://arxiv.org/abs/1905.11006\" target=\"_blank\">Gu, Wang, Zhao</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>MBR, softmax margin, PAPB, S2S</td>\n<td>Brno, JHU, MERL</td>\n<td><a href=\"https://arxiv.org/abs/1811.02770\" target=\"_blank\">Baskar et al.</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>OCD, S2S</td>\n<td>Google Brain</td>\n<td><a href=\"https://arxiv.org/abs/1810.01398\" target=\"_blank\">Sabour, Chan, Norouzi</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>REINFORCE, S2S</td>\n<td>Nara, RIKEN</td>\n<td><a href=\"https://ahcweb01.naist.jp/papers/journal/2019/201906_IEEE_andros-tj_1/201906_IEEE_andros-tj_1.paper.pdf\" target=\"_blank\">Tjandra et al.</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>TS</td>\n<td>Sentence</td>\n<td>Alternating Actor-Critic</td>\n<td>Hong Kong, Tencent</td>\n<td><a href=\"https://arxiv.org/abs/1803.11070\" target=\"_blank\">Li, Bing, Lam</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>REINFORCE, PPO, Reward shaping</td>\n<td>Tokyo</td>\n<td><a href=\"http://www.apsipa.org/proceedings/2018/pdfs/0001934.pdf\" target=\"_blank\">Peng, Shibata, Shinozaki</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>REINFORCE, Self-critic</td>\n<td>Salesforce</td>\n<td><a href=\"https://arxiv.org/abs/1712.07101\" target=\"_blank\">Zhou, Xiong, Socher</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, LAS, Sampling, N-best</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/1712.01818\" target=\"_blank\">Prabhavalkar et al.</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Expected Loss, RNA</td>\n<td>Google</td>\n<td><a href=\"https://pdfs.semanticscholar.org/7703/a2c5468ecbee5b62c048339a03358ed5fe19.pdf\" target=\"_blank\">Sak et al.</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>Actor-Critic, Critic-aware</td>\n<td>Hong Kong, New York</td>\n<td><a href=\"https://arxiv.org/abs/1702.02429\" target=\"_blank\">Gu, Cho, Li</a></td>\n</tr>\n<tr>\n<td>2016</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Reward Augmented ML</td>\n<td>Google Brain</td>\n<td><a href=\"https://arxiv.org/abs/1609.00150\" target=\"_blank\">Norouzi et al.</a></td>\n</tr>\n<tr>\n<td>2016</td>\n<td>MT</td>\n<td>Token</td>\n<td>Actor-Critic</td>\n<td>Montreal, McGill</td>\n<td><a href=\"https://arxiv.org/abs/1607.07086\" target=\"_blank\">Bahdanau et al.</a></td>\n</tr>\n<tr>\n<td>2015</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>MIXER</td>\n<td>Facebook</td>\n<td><a href=\"https://arxiv.org/abs/1511.06732\" target=\"_blank\">Ranzato et al.</a></td>\n</tr>\n<tr>\n<td>2015</td>\n<td>ASR</td>\n<td>Token</td>\n<td>Task Loss Estimation</td>\n<td>Montreal, Wrocław</td>\n<td><a href=\"https://arxiv.org/abs/1511.06456\" target=\"_blank\">Bahdanau et al.</a></td>\n</tr>\n<tr>\n<td>2014</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Expected Loss, CTC</td>\n<td>DeepMind, Toronto</td>\n<td><a href=\"http://proceedings.mlr.press/v32/graves14.pdf\" target=\"_blank\">Graves, Jaitly</a></td>\n</tr>\n</tbody>\n</table>",
  "messages": [
    {
      "id": 2409271,
      "postDate": "2023-08-26T06:26:12.150Z",
      "content": "<p>Anyone made any other loss function than CrossEntropy or CTC work? We looked at MWER loss, smoothed edit distance loss but saw no benefit for our model. I worked through list of papers found under <a href=\"https://github.com/1ytic/edit-distance-papers\" target=\"_blank\">https://github.com/1ytic/edit-distance-papers</a></p>\n<table>\n<thead>\n<tr>\n<th>Year</th>\n<th>Task</th>\n<th>Reward level</th>\n<th>Algorithms, Models</th>\n<th>Affiliation</th>\n<th>Authors, Link</th>\n</tr>\n</thead>\n<tbody>\n<tr>\n<td>2020</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, RNN-T</td>\n<td>Amazon</td>\n<td><a href=\"https://arxiv.org/abs/2007.13802\" target=\"_blank\">Guo et al.</a></td>\n</tr>\n<tr>\n<td>2020</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>MGS, parameter search</td>\n<td>NYU</td>\n<td><a href=\"https://arxiv.org/abs/2006.03158\" target=\"_blank\">Welleck, Cho</a></td>\n</tr>\n<tr>\n<td>2020</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Proper Noun, Phonetic Fuzzing, MWER, RNN-T, LAS</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/2005.09756\" target=\"_blank\">Peyser, Sainath, Pundak</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>NLP</td>\n<td>Sentence</td>\n<td>GPT-2, PPO, Human labeling</td>\n<td>OpenAI</td>\n<td><a href=\"https://arxiv.org/abs/1909.08593\" target=\"_blank\">Ziegler, Stiennon et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Neural Architecture Search, REINFORCE, CTC</td>\n<td>KPMG Nigeria, OAU</td>\n<td><a href=\"https://arxiv.org/abs/1912.05946\" target=\"_blank\">Baruwa et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Normalized MWER</td>\n<td>Amazon</td>\n<td><a href=\"https://arxiv.org/abs/1912.03363\" target=\"_blank\">Gandhe, Rastrow</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Token</td>\n<td>MBR, RNN-T</td>\n<td>Tencent, USA</td>\n<td><a href=\"https://arxiv.org/abs/1911.12487\" target=\"_blank\">Weng et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Token</td>\n<td>ECTC-DOCD</td>\n<td>China</td>\n<td><a href=\"https://www.isca-speech.org/archive/Interspeech_2019/pdfs/1212.pdf\" target=\"_blank\">Yi, Wang, Xu</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, RNN-T, LAS</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/1908.10992\" target=\"_blank\">Sainath, Pang et al</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>MT</td>\n<td>Token</td>\n<td>Reinforce-NAT, Non-Autoregressive Transformer</td>\n<td>China, Tencent</td>\n<td><a href=\"https://arxiv.org/abs/1906.09444\" target=\"_blank\">Shao, Feng et al.</a></td>\n</tr>\n<tr>\n<td>2019</td>\n<td>MT, TS, APE</td>\n<td>Token</td>\n<td>Levenshtein Transformer, imitation learning</td>\n<td>Facebook, New York</td>\n<td><a href=\"https://arxiv.org/abs/1905.11006\" target=\"_blank\">Gu, Wang, Zhao</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>MBR, softmax margin, PAPB, S2S</td>\n<td>Brno, JHU, MERL</td>\n<td><a href=\"https://arxiv.org/abs/1811.02770\" target=\"_blank\">Baskar et al.</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>OCD, S2S</td>\n<td>Google Brain</td>\n<td><a href=\"https://arxiv.org/abs/1810.01398\" target=\"_blank\">Sabour, Chan, Norouzi</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Token</td>\n<td>REINFORCE, S2S</td>\n<td>Nara, RIKEN</td>\n<td><a href=\"https://ahcweb01.naist.jp/papers/journal/2019/201906_IEEE_andros-tj_1/201906_IEEE_andros-tj_1.paper.pdf\" target=\"_blank\">Tjandra et al.</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>TS</td>\n<td>Sentence</td>\n<td>Alternating Actor-Critic</td>\n<td>Hong Kong, Tencent</td>\n<td><a href=\"https://arxiv.org/abs/1803.11070\" target=\"_blank\">Li, Bing, Lam</a></td>\n</tr>\n<tr>\n<td>2018</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>REINFORCE, PPO, Reward shaping</td>\n<td>Tokyo</td>\n<td><a href=\"http://www.apsipa.org/proceedings/2018/pdfs/0001934.pdf\" target=\"_blank\">Peng, Shibata, Shinozaki</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>REINFORCE, Self-critic</td>\n<td>Salesforce</td>\n<td><a href=\"https://arxiv.org/abs/1712.07101\" target=\"_blank\">Zhou, Xiong, Socher</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>MWER, LAS, Sampling, N-best</td>\n<td>Google</td>\n<td><a href=\"https://arxiv.org/abs/1712.01818\" target=\"_blank\">Prabhavalkar et al.</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Expected Loss, RNA</td>\n<td>Google</td>\n<td><a href=\"https://pdfs.semanticscholar.org/7703/a2c5468ecbee5b62c048339a03358ed5fe19.pdf\" target=\"_blank\">Sak et al.</a></td>\n</tr>\n<tr>\n<td>2017</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>Actor-Critic, Critic-aware</td>\n<td>Hong Kong, New York</td>\n<td><a href=\"https://arxiv.org/abs/1702.02429\" target=\"_blank\">Gu, Cho, Li</a></td>\n</tr>\n<tr>\n<td>2016</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Reward Augmented ML</td>\n<td>Google Brain</td>\n<td><a href=\"https://arxiv.org/abs/1609.00150\" target=\"_blank\">Norouzi et al.</a></td>\n</tr>\n<tr>\n<td>2016</td>\n<td>MT</td>\n<td>Token</td>\n<td>Actor-Critic</td>\n<td>Montreal, McGill</td>\n<td><a href=\"https://arxiv.org/abs/1607.07086\" target=\"_blank\">Bahdanau et al.</a></td>\n</tr>\n<tr>\n<td>2015</td>\n<td>MT</td>\n<td>Sentence</td>\n<td>MIXER</td>\n<td>Facebook</td>\n<td><a href=\"https://arxiv.org/abs/1511.06732\" target=\"_blank\">Ranzato et al.</a></td>\n</tr>\n<tr>\n<td>2015</td>\n<td>ASR</td>\n<td>Token</td>\n<td>Task Loss Estimation</td>\n<td>Montreal, Wrocław</td>\n<td><a href=\"https://arxiv.org/abs/1511.06456\" target=\"_blank\">Bahdanau et al.</a></td>\n</tr>\n<tr>\n<td>2014</td>\n<td>ASR</td>\n<td>Sentence</td>\n<td>Expected Loss, CTC</td>\n<td>DeepMind, Toronto</td>\n<td><a href=\"http://proceedings.mlr.press/v32/graves14.pdf\" target=\"_blank\">Graves, Jaitly</a></td>\n</tr>\n</tbody>\n</table>",
      "rawMarkdown": "Anyone made any other loss function than CrossEntropy or CTC work? We looked at MWER loss, smoothed edit distance loss but saw no benefit for our model. I worked through list of papers found under https://github.com/1ytic/edit-distance-papers\n\n\n\n| Year | Task | Reward level | Algorithms, Models | Affiliation | Authors, Link |\n|:----:|:----:|--------------|--------------------|-------------|---------------|\n| 2020 | ASR | Sentence | MWER, RNN-T | Amazon | [Guo et al.](https://arxiv.org/abs/2007.13802)|\n| 2020 | MT | Sentence | MGS, parameter search | NYU | [Welleck, Cho](https://arxiv.org/abs/2006.03158)|\n| 2020 | ASR | Sentence | Proper Noun, Phonetic Fuzzing, MWER, RNN-T, LAS | Google | [Peyser, Sainath, Pundak](https://arxiv.org/abs/2005.09756)|\n| 2019 | NLP | Sentence | GPT-2, PPO, Human labeling | OpenAI | [Ziegler, Stiennon et al.](https://arxiv.org/abs/1909.08593)|\n| 2019 | ASR | Sentence | Neural Architecture Search, REINFORCE, CTC | KPMG Nigeria, OAU  | [Baruwa et al.](https://arxiv.org/abs/1912.05946)|\n| 2019 | ASR | Sentence | Normalized MWER | Amazon | [Gandhe, Rastrow](https://arxiv.org/abs/1912.03363)|\n| 2019 | ASR | Token | MBR, RNN-T | Tencent, USA | [Weng et al.](https://arxiv.org/abs/1911.12487)|\n| 2019 | ASR | Token | ECTC-DOCD | China | [Yi, Wang, Xu](https://www.isca-speech.org/archive/Interspeech_2019/pdfs/1212.pdf)|\n| 2019 | ASR | Sentence | MWER, RNN-T, LAS | Google | [Sainath, Pang et al](https://arxiv.org/abs/1908.10992)|\n| 2019 | MT  | Token | Reinforce-NAT, Non-Autoregressive Transformer | China, Tencent | [Shao, Feng et al.](https://arxiv.org/abs/1906.09444)|\n| 2019 | MT, TS, APE | Token | Levenshtein Transformer, imitation learning | Facebook, New York | [Gu, Wang, Zhao](https://arxiv.org/abs/1905.11006)|\n| 2018 | ASR | Token | MBR, softmax margin, PAPB, S2S | Brno, JHU, MERL | [Baskar et al.](https://arxiv.org/abs/1811.02770)|\n| 2018 | ASR | Token | OCD, S2S | Google Brain | [Sabour, Chan, Norouzi](https://arxiv.org/abs/1810.01398)|\n| 2018 | ASR | Token | REINFORCE, S2S | Nara, RIKEN | [Tjandra et al.](https://ahcweb01.naist.jp/papers/journal/2019/201906_IEEE_andros-tj_1/201906_IEEE_andros-tj_1.paper.pdf)|\n| 2018 | TS  | Sentence | Alternating Actor-Critic | Hong Kong, Tencent | [Li, Bing, Lam](https://arxiv.org/abs/1803.11070)|\n| 2018 | ASR | Sentence | REINFORCE, PPO, Reward shaping | Tokyo |[Peng, Shibata, Shinozaki](http://www.apsipa.org/proceedings/2018/pdfs/0001934.pdf)|\n| 2017 | ASR | Sentence | REINFORCE, Self-critic | Salesforce | [Zhou, Xiong, Socher](https://arxiv.org/abs/1712.07101)|\n| 2017 | ASR | Sentence | MWER, LAS, Sampling, N-best | Google |[Prabhavalkar et al.](https://arxiv.org/abs/1712.01818)|\n| 2017 | ASR | Sentence | Expected Loss, RNA | Google | [Sak et al.](https://pdfs.semanticscholar.org/7703/a2c5468ecbee5b62c048339a03358ed5fe19.pdf)|\n| 2017 | MT  | Sentence | Actor-Critic, Critic-aware | Hong Kong, New York | [Gu, Cho, Li](https://arxiv.org/abs/1702.02429)|\n| 2016 | ASR | Sentence | Reward Augmented ML | Google Brain | [Norouzi et al.](https://arxiv.org/abs/1609.00150)|\n| 2016 | MT  | Token | Actor-Critic | Montreal, McGill | [Bahdanau et al.](https://arxiv.org/abs/1607.07086)|\n| 2015 | MT  | Sentence | MIXER | Facebook | [Ranzato et al.](https://arxiv.org/abs/1511.06732)|\n| 2015 | ASR | Token | Task Loss Estimation | Montreal, Wrocław | [Bahdanau et al.](https://arxiv.org/abs/1511.06456)|\n| 2014 | ASR | Sentence | Expected Loss, CTC | DeepMind, Toronto | [Graves, Jaitly](http://proceedings.mlr.press/v32/graves14.pdf)|\n",
      "votes": 7
    },
    {
      "id": 2411231,
      "postDate": "2023-08-27T13:41:37.953Z",
      "content": "<p>Just posted my solution - I got MWER training to work but the contribution on the final ensemble was modest: +0.001 - +0.002. This was with beam search with a size 5 beam. With greedy decoding gains were around +0.005 in local eval. When I used weaker (underfitted?) models, the gains were fairly sizeable. I also used it as an auxiliary loss, but it had no effect except for slowing things down massively 😀<br>\nI pretty much did it as in <a href=\"https://arxiv.org/pdf/1712.01818.pdf\" target=\"_blank\">Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models</a>. The normalization was important as was using a small lambda (0.01).<br>\nBut the whole procedure wasn't very stable, even after optimizing params, results varried a lot and the best result was usually achieved within 4 epochs with a small LR around 1e-5.</p>\n<p>Congratz on your win!</p>",
      "rawMarkdown": "Just posted my solution - I got MWER training to work but the contribution on the final ensemble was modest: +0.001 - +0.002. This was with beam search with a size 5 beam. With greedy decoding gains were around +0.005 in local eval. When I used weaker (underfitted?) models, the gains were fairly sizeable. I also used it as an auxiliary loss, but it had no effect except for slowing things down massively 😀\nI pretty much did it as in [Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models](https://arxiv.org/pdf/1712.01818.pdf). The normalization was important as was using a small lambda (0.01).\nBut the whole procedure wasn't very stable, even after optimizing params, results varried a lot and the best result was usually achieved within 4 epochs with a small LR around 1e-5.\n\nCongratz on your win!",
      "votes": 1,
      "replies": [
        {
          "id": 2411790,
          "postDate": "2023-08-27T21:25:16.843Z",
          "content": "<p>Interesting. I also got MWER training to work technically. But general stability is an issue. I just tried it as a combi loss with normal CrossEntropy already when start training from scratch, but might have been better to finetune some good models with it for a few epochs. When using batched edit distance it was quite fast. I took it from this inconspicuous repository: <a href=\"https://github.com/francescocastelli/torchdistance\" target=\"_blank\">https://github.com/francescocastelli/torchdistance</a><br>\nI was also wondering if not the time shifts introduced with naïve cutmix (i.e. not correctly aligned cuts of sequence and phrases) already make CrossEntropy more robust in terms of time-shifts, and thats the reason we did not see benefits from MWER training. </p>",
          "rawMarkdown": "Interesting. I also got MWER training to work technically. But general stability is an issue. I just tried it as a combi loss with normal CrossEntropy already when start training from scratch, but might have been better to finetune some good models with it for a few epochs. When using batched edit distance it was quite fast. I took it from this inconspicuous repository: https://github.com/francescocastelli/torchdistance\nI was also wondering if not the time shifts introduced with naïve cutmix (i.e. not correctly aligned cuts of sequence and phrases) already make CrossEntropy more robust in terms of time-shifts, and thats the reason we did not see benefits from MWER training. ",
          "votes": 1
        }
      ]
    }
  ],
  "comments": [
    {
      "id": 2411231,
      "author_name": "flg",
      "author_url": "",
      "post_date": "2023-08-27T13:41:37.953000",
      "content": "<p>Just posted my solution - I got MWER training to work but the contribution on the final ensemble was modest: +0.001 - +0.002. This was with beam search with a size 5 beam. With greedy decoding gains were around +0.005 in local eval. When I used weaker (underfitted?) models, the gains were fairly sizeable. I also used it as an auxiliary loss, but it had no effect except for slowing things down massively 😀<br>\nI pretty much did it as in <a href=\"https://arxiv.org/pdf/1712.01818.pdf\" target=\"_blank\">Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models</a>. The normalization was important as was using a small lambda (0.01).<br>\nBut the whole procedure wasn't very stable, even after optimizing params, results varried a lot and the best result was usually achieved within 4 epochs with a small LR around 1e-5.</p>\n<p>Congratz on your win!</p>",
      "votes": 1,
      "replies": [
        {
          "id": 2411790,
          "author_name": "Dieter",
          "author_url": "",
          "post_date": "2023-08-27T21:25:16.843000",
          "content": "<p>Interesting. I also got MWER training to work technically. But general stability is an issue. I just tried it as a combi loss with normal CrossEntropy already when start training from scratch, but might have been better to finetune some good models with it for a few epochs. When using batched edit distance it was quite fast. I took it from this inconspicuous repository: <a href=\"https://github.com/francescocastelli/torchdistance\" target=\"_blank\">https://github.com/francescocastelli/torchdistance</a><br>\nI was also wondering if not the time shifts introduced with naïve cutmix (i.e. not correctly aligned cuts of sequence and phrases) already make CrossEntropy more robust in terms of time-shifts, and thats the reason we did not see benefits from MWER training. </p>",
          "votes": 1,
          "replies": []
        }
      ]
    }
  ],
  "raw_markdown_by_id": {
    "2409271": "Anyone made any other loss function than CrossEntropy or CTC work? We looked at MWER loss, smoothed edit distance loss but saw no benefit for our model. I worked through list of papers found under https://github.com/1ytic/edit-distance-papers\n\n\n\n| Year | Task | Reward level | Algorithms, Models | Affiliation | Authors, Link |\n|:----:|:----:|--------------|--------------------|-------------|---------------|\n| 2020 | ASR | Sentence | MWER, RNN-T | Amazon | [Guo et al.](https://arxiv.org/abs/2007.13802)|\n| 2020 | MT | Sentence | MGS, parameter search | NYU | [Welleck, Cho](https://arxiv.org/abs/2006.03158)|\n| 2020 | ASR | Sentence | Proper Noun, Phonetic Fuzzing, MWER, RNN-T, LAS | Google | [Peyser, Sainath, Pundak](https://arxiv.org/abs/2005.09756)|\n| 2019 | NLP | Sentence | GPT-2, PPO, Human labeling | OpenAI | [Ziegler, Stiennon et al.](https://arxiv.org/abs/1909.08593)|\n| 2019 | ASR | Sentence | Neural Architecture Search, REINFORCE, CTC | KPMG Nigeria, OAU  | [Baruwa et al.](https://arxiv.org/abs/1912.05946)|\n| 2019 | ASR | Sentence | Normalized MWER | Amazon | [Gandhe, Rastrow](https://arxiv.org/abs/1912.03363)|\n| 2019 | ASR | Token | MBR, RNN-T | Tencent, USA | [Weng et al.](https://arxiv.org/abs/1911.12487)|\n| 2019 | ASR | Token | ECTC-DOCD | China | [Yi, Wang, Xu](https://www.isca-speech.org/archive/Interspeech_2019/pdfs/1212.pdf)|\n| 2019 | ASR | Sentence | MWER, RNN-T, LAS | Google | [Sainath, Pang et al](https://arxiv.org/abs/1908.10992)|\n| 2019 | MT  | Token | Reinforce-NAT, Non-Autoregressive Transformer | China, Tencent | [Shao, Feng et al.](https://arxiv.org/abs/1906.09444)|\n| 2019 | MT, TS, APE | Token | Levenshtein Transformer, imitation learning | Facebook, New York | [Gu, Wang, Zhao](https://arxiv.org/abs/1905.11006)|\n| 2018 | ASR | Token | MBR, softmax margin, PAPB, S2S | Brno, JHU, MERL | [Baskar et al.](https://arxiv.org/abs/1811.02770)|\n| 2018 | ASR | Token | OCD, S2S | Google Brain | [Sabour, Chan, Norouzi](https://arxiv.org/abs/1810.01398)|\n| 2018 | ASR | Token | REINFORCE, S2S | Nara, RIKEN | [Tjandra et al.](https://ahcweb01.naist.jp/papers/journal/2019/201906_IEEE_andros-tj_1/201906_IEEE_andros-tj_1.paper.pdf)|\n| 2018 | TS  | Sentence | Alternating Actor-Critic | Hong Kong, Tencent | [Li, Bing, Lam](https://arxiv.org/abs/1803.11070)|\n| 2018 | ASR | Sentence | REINFORCE, PPO, Reward shaping | Tokyo |[Peng, Shibata, Shinozaki](http://www.apsipa.org/proceedings/2018/pdfs/0001934.pdf)|\n| 2017 | ASR | Sentence | REINFORCE, Self-critic | Salesforce | [Zhou, Xiong, Socher](https://arxiv.org/abs/1712.07101)|\n| 2017 | ASR | Sentence | MWER, LAS, Sampling, N-best | Google |[Prabhavalkar et al.](https://arxiv.org/abs/1712.01818)|\n| 2017 | ASR | Sentence | Expected Loss, RNA | Google | [Sak et al.](https://pdfs.semanticscholar.org/7703/a2c5468ecbee5b62c048339a03358ed5fe19.pdf)|\n| 2017 | MT  | Sentence | Actor-Critic, Critic-aware | Hong Kong, New York | [Gu, Cho, Li](https://arxiv.org/abs/1702.02429)|\n| 2016 | ASR | Sentence | Reward Augmented ML | Google Brain | [Norouzi et al.](https://arxiv.org/abs/1609.00150)|\n| 2016 | MT  | Token | Actor-Critic | Montreal, McGill | [Bahdanau et al.](https://arxiv.org/abs/1607.07086)|\n| 2015 | MT  | Sentence | MIXER | Facebook | [Ranzato et al.](https://arxiv.org/abs/1511.06732)|\n| 2015 | ASR | Token | Task Loss Estimation | Montreal, Wrocław | [Bahdanau et al.](https://arxiv.org/abs/1511.06456)|\n| 2014 | ASR | Sentence | Expected Loss, CTC | DeepMind, Toronto | [Graves, Jaitly](http://proceedings.mlr.press/v32/graves14.pdf)|\n",
    "2411231": "Just posted my solution - I got MWER training to work but the contribution on the final ensemble was modest: +0.001 - +0.002. This was with beam search with a size 5 beam. With greedy decoding gains were around +0.005 in local eval. When I used weaker (underfitted?) models, the gains were fairly sizeable. I also used it as an auxiliary loss, but it had no effect except for slowing things down massively 😀\nI pretty much did it as in [Minimum Word Error Rate Training for Attention-based Sequence-to-Sequence Models](https://arxiv.org/pdf/1712.01818.pdf). The normalization was important as was using a small lambda (0.01).\nBut the whole procedure wasn't very stable, even after optimizing params, results varried a lot and the best result was usually achieved within 4 epochs with a small LR around 1e-5.\n\nCongratz on your win!"
  }
}