DEV Community

Matheus de Camargo Marques
Matheus de Camargo Marques

Posted on

Modelo Jev chegou ao mesmo tempo que eu estudava a técnica de Destilação. E isso me deixou com uma pulga atrás da orelha.

Modelo Jev chegou ao mesmo tempo que eu estudava a técnica de Destilação. E isso me deixou com uma pulga atrás da orelha.

O Jev da TypeSafe promete decisões estruturadas, rápido e barato. A comunidade desconfia da "inovação que promete". Por quê? Porque o comportamento dele lembra muito o de um modelo bem destilado.

Destilação é uma técnica antiga. Em 2006, Bucilă, Caruana e Niculescu-Mizil publicaram "Model Compression", com a ideia de professor-aluno: um modelo grande ensina um modelo menor. Em 2015, Hinton, Vinyals e Dean popularizaram o termo "knowledge distillation" e os "soft targets": o aluno aprende a distribuição de probabilidades do professor, não só a resposta certa.

Se a TypeSafe usou um modelo de fronteira como professor e treinou um aluno menor, o resultado esperado seria exatamente: mais rápido, mais barato e com desempenho semelhante nas tarefas para as quais foi destilado. Isso bate com as alegações do Jev.

O problema não é usar destilação. Destilação é legítima. O problema é apresentar isso como uma nova classe de modelo sem publicar um artigo técnico. A TypeSafe não divulgou arquitetura, pesos ou paper. A comunidade já tentou reproduzir o Jev por meios independentes, e os testes mostram que ele é rápido e barato, mas não provam inovação fundamental.

Resumo: o Jev pode ser útil. Mas, sem artigo, a tese de "nova classe de modelo" é marketing até prova em contrário. Não é erro usar destilação. É erro chamar de revolução o que talvez seja engenharia conhecida.

Top comments (0)