Eikos-4B no benchmark de decisões em português do Brasil

#2
by ajgcvm - opened

Oi Caio, sou o Antonio, da Felhen. Rodamos o Eikos-4B no benchmark aberto de decisões tipadas em português do Brasil que publicamos: sete tarefas com texto brasileiro real e rótulo humano. Usamos o código de inferência do próprio Eikos e o mesmo protocolo dos outros modelos. Resultado: 60,7% de acurácia balanceada média.

A tabela completa e o método estão aqui: https://huggingface.co/spaces/felhen-ai/ptbr-typed-decisions-leaderboard

Se fizer sentido para você, medimos também o Eikos nas duas provas privadas do ranking: uma de uso real (e-mails e comentários) e uma prova fresca com proposições da Câmara posteriores ao treino dos modelos. É só indicar a versão que você considera a de referência. Para uma versão nova, o avaliador roda com um comando: https://github.com/felhen-ai/saracura/blob/main/research/ptbr_bench.py

Boa!! fico feliz que gostou! o 27b acaba sendo melhor do que o 4b, mas é muito bom também!
se conseguir, experimenta o https://huggingface.co/collections/caiovicentino1/ekbasis
esse é bem legal!

Obrigado, Caio! Vou olhar a coleção ekbasis. Sobre o 27B: se houver uma versão quantizada que caiba em 32 GB de GPU, conseguimos medir no mesmo protocolo e colocar na tabela ao lado do 4B.

Sign up or log in to comment