Modelo Jev chegou ao mesmo tempo que eu estudava a técnica de Destilação. E isso me deixou com uma pulga atrás da orelha.
O Jev da TypeSafe promete decisões estruturadas, rápido e barato. A comunidade desconfia da "inovação que promete". Por quê? Porque o comportamento dele lembra muito o de um modelo bem destilado.
Destilação é uma técnica antiga. Em 2006, Bucilă, Caruana e Niculescu-Mizil publicaram "Model Compression", com a ideia de professor-aluno: um modelo grande ensina um modelo menor. Em 2015, Hinton, Vinyals e Dean popularizaram o termo "knowledge distillation" e os "soft targets": o aluno aprende a distribuição de probabilidades do professor, não só a resposta certa.
Se a TypeSafe usou um modelo de fronteira como professor e treinou um aluno menor, o resultado esperado seria exatamente: mais rápido, mais barato e com desempenho semelhante nas tarefas para as quais foi destilado. Isso bate com as alegações do Jev.
O problema não é usar destilação. Destilação é legítima. O problema é apresentar isso como uma nova classe de modelo sem publicar um artigo técnico. A TypeSafe não divulgou arquitetura, pesos ou paper. A comunidade já tentou reproduzir o Jev por meios independentes, e os testes mostram que ele é rápido e barato, mas não provam inovação fundamental.
Resumo: o Jev pode ser útil. Mas, sem artigo, a tese de "nova classe de modelo" é marketing até prova em contrário. Não é erro usar destilação. É erro chamar de revolução o que talvez seja engenharia conhecida.
Top comments (0)