Skip to content
Open
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
Original file line number Diff line number Diff line change
@@ -0,0 +1,9 @@

# SimpleText@CLEF-2022 Chamada para papéis

[Início](./) | [Chamada para papéis](./CFP) | [Datas importantes](./dates) | [Tarefas](./tasks) | [Ferramentas](./tools)

[Programa](./program) | [Publicações](./publications) | [Organizadores](./organisers) | [Portefólio](./portefolio)
[<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](../fr/CFP) [<img src="https://upload.wikimedia.org/wikipedia/commons/f/f2/Flag_of_Great_Britain_%281707–1800%29.svg?raw=true" width="30">](../en/CFP) [<img src="https://icons.iconarchive.com/icons/wikipedia/flags/128/PT-Portugal-Flag-icon.png?raw=true" width="30">](../pt/CFP)

---
28 changes: 14 additions & 14 deletions clef/en/tools.md
Original file line number Diff line number Diff line change
@@ -1,20 +1,20 @@
# SimpleText@CLEF-2022 Tools
# Ferramentas SimpleText@CLEF-2022

[Home](./) | [Call for papers](./CFP) | [Important dates](./dates) | [Tasks](./tasks) | [Tools](./tools)
[Program](./program) | [Publications](./publications) | [Organisers](./organisers) | [Contact](./contact) | [<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](https://simpletext-madics.github.io/2022/clef/)
[Início](./) | [Chamada de trabalhos](./CFP) | [Datas importantes](./datas) | [Tarefas](./tarefas) | [Ferramentas](./ferramentas)
[Programa](./programa) | [Publicações](./publicações) | [Organizadores](./organizadores) | [Contacto](./contacto) | [<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](https://simpletext-madics.github.io/2022/clef/)

---

## Relevant literature & tools
### Task 1: Automatic summarization tools
* **JURASSIC**: AI21 Studio provides access to Jurassic-1 suite of language models. Jurassic-1 is large AI model able to transform an existing text. One common transformation is summarization. Summarization task can be fine-tuned via the AI21 API or in the GUI [https://www.ai21.com/blog/ai21-studio-use-cases](https://www.ai21.com/blog/ai21-studio-use-cases)
* **GPT-2** is a large-scale unsupervised language model which performs machine translation, question answering, and summarization without task-specific training [https://github.com/openai/gpt-2](https://github.com/openai/gpt-2)
* **Multilingual T5 (mT5)** is a large multilingual pretrained text-to-text transformer model developped by Google covering 101 languages. mT5 can be fine-tuned for any text-to-text generation. It is possible to fine-tune the mT5 model by using the [SimpleT5 library](https://github.com/Shivanandroy/simpleT5/). [https://github.com/google-research/multilingual-t5](https://github.com/google-research/multilingual-t5)
## Literatura e ferramentas relevantes
### Tarefa 1: Ferramentas de sumarização automática
* **JURASSIC***: AI21 Studio fornece acesso ao conjunto Jurássico-1 de modelos linguísticos. O Jurassic-1 é um grande modelo de IA capaz de transformar um texto existente. Uma transformação comum é o resumo. A tarefa de sumarização pode ser aperfeiçoada através do AI21 API ou na GUI [https://www.ai21.com/blog/ai21-studio-use-cases](https://www.ai21.com/blog/ai21-studio-use-cases)
* **GPT-2*** é um modelo linguístico em grande escala sem supervisão que efectua tradução automática, resposta a perguntas e resumo sem formação específica de tarefas [https://github.com/openai/gpt-2](https://github.com/openai/gpt-2)
**Multilingual T5 (mT5)** é um grande modelo de transformador texto-para-texto multilingue pré-treinado desenvolvido pelo Google abrangendo 101 línguas. mT5 pode ser aperfeiçoado para qualquer geração de texto-para-texto. É possível afinar o modelo mT5 usando a [biblioteca SimpleT5](https://github.com/Shivanandroy/simpleT5/). [https://github.com/google-research/multilingual-t5](https://github.com/google-research/multilingual-t5)

### Task 2: Terminology management tools
* **IDF**: Robertson, S. (2004), "Understanding inverse document frequency: on theoretical arguments for IDF", Journal of Documentation, Vol. 60 No. 5, pp. 503-520. [https://doi.org/10.1108/00220410410560582](https://doi.org/10.1108/00220410410560582)
### Tarefa 2: Ferramentas de gestão terminológica
* **IDF***: Robertson, S. (2004), "Understanding inverse document frequency: on theoretical arguments for IDF", Journal of Documentation, Vol. 60 No. 5, pp. 503-520. [https://doi.org/10.1108/00220410410560582](https://doi.org/10.1108/00220410410560582)

### Task 3: Text simplification tools
* **JURASSIC**: AI21 Studio provides access to Jurassic-1 suite of language models. Jurassic-1 Jumbo is the largest model publicly available with no waitlist. The AI21 studio's playground provides ready-to-use promts for text simplification (see De-Jargonizer) [https://www.ai21.com/studio](https://www.ai21.com/studio)
* **GPT-2** is a large-scale unsupervised language model which performs machine translation, question answering, and summarization without task-specific training [https://github.com/openai/gpt-2](https://github.com/openai/gpt-2)
* **Multilingual T5 (mT5)** transformer model can be fine-tuned for text simplification e.g. by using [SimpleT5 library](https://github.com/Shivanandroy/simpleT5/). [https://github.com/google-research/multilingual-t5](https://github.com/google-research/multilingual-t5)
### Tarefa 3: Ferramentas de simplificação de texto
* **JURASSIC***: AI21 Studio fornece acesso ao conjunto Jurássico-1 de modelos linguísticos. O Jurassic-1 Jumbo é o maior modelo disponível ao público sem lista de espera. O parque infantil do AI21 Studio oferece promoções prontas a usar para a simplificação de textos (ver De-Jargonizer) [https://www.ai21.com/studio](https://www.ai21.com/studio)
* **GPT-2*** é um modelo linguístico em grande escala sem supervisão que efectua tradução automática, resposta a perguntas e resumo sem formação específica de tarefas [https://github.com/openai/gpt-2](https://github.com/openai/gpt-2)
* **Multilingue T5 (mT5)** modelo de transformador pode ser afinado para simplificação de texto, por exemplo, usando [biblioteca SimpleT5](https://github.com/Shivanandroy/simpleT5/). [https://github.com/google-research/multilingual-t5](https://github.com/google-research/multilingual-t5)
65 changes: 65 additions & 0 deletions clef/pt/CFP.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,65 @@
# SimpleText@CLEF-2022 Chamada para papéis

[Início](./) | [Chamada para papéis](./CFP) | [Datas importantes](./dates) | [Tarefas](./tasks) | [Ferramentas](./tools)
[Programa](./program) | [Publicações](./publications) | [Organizadores](./organisers) | [Portefólio](./portefolio) | [<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](../fr/CFP)

---

## Prazos de entrega

* Submissões: 9 de Maio 2022 (AoE)
* Notificações: 6 de Junho 2022
* Conferência CLEF: 5 - 8 de Setembro 2022

Para mais detalhes, veja [CLEF 2022 Website](https://clef2022.clef-initiative.eu/index.php)

## Contexto do workshop
A literacia científica, incluindo questões relacionadas com a saúde, é importante para permitir que as pessoas tomem decisões informadas, avaliem a qualidade da informação, mantenham a saúde fisiológica e mental. Por exemplo, as histórias que os indivíduos consideram credíveis podem determinar a sua resposta à pandemia COVID-19, incluindo a aplicação do distanciamento social, utilizando tratamentos médicos falsos perigosos, ou a compra de produtos em pânico. Infelizmente, as histórias nos meios de comunicação social podem ser mais fáceis de compreender pelos leigos do que os artigos científicos devido à falta de conhecimentos anteriores ou de linguagem complexa e vernácula interna. Textos científicos tais como publicações de investigação também podem ser difíceis de compreender para peritos ou cientistas fora do domínio da publicação. Melhorar a compreensibilidade do texto e a sua adaptação a diferentes audiências continua a ser um problema por resolver. De uma perspectiva social, o SimpleText será um passo em frente para tornar a investigação realmente aberta, acessível e compreensível para todos [[1]](#bibliografia), para desenvolver uma contra-fala a notícias falsas baseadas em resultados científicos, para permitir que as pessoas leiam mais rapidamente e, consequentemente, se tornem mais conscientes dos resultados científicos, especialmente com uma explosão de ciência aberta durante a actual pandemia da COVID-19. Os textos simplificados são também mais acessíveis para falantes não nativos [[2]](#bibliografia), jovens leitores e pessoas com deficiência de leitura [[3]](#bibliografia). Além disso, a simplificação de textos permite a melhoria das aplicações de mineração de texto e PNL, incluindo resultados de tradução automática [[4]](#bibliografia). Assim, a simplificação automática de textos poderia ser útil para vários domínios, tais como comunicação científica, jornalismo científico, política, e educação.

Traduzido com a versão gratuita do tradutor - www.DeepL.com/Translator
## Prazos de entrega das submissões
Submissões should be written in English following the CEURART 1-column paper style and be submitted as PDF files via the EasyChair system. Papers (except extended abstracts) will be refereed through double-blind peer review. The papers should be original, i.e. not published in an earlier workshop or conference or journal, except for extended abstracts. Literature reviews, position and demo papers, papers on ongoing work or negative results are welcomed. Extended abstracts of previously published works are also welcome. We accept the following types of submissions:

1. Resumos alargados de 500-1000 palavras com referências bibliográficas. As referências bibliográficas estão excluídas da contagem de palavras. Artigos publicados anteriormente podem ser aceites como resumos alargados (por favor, forneça uma referência ao seu trabalho anterior neste caso).
2. Trabalhos regulares de 10-12 páginas padrão com um número apropriado de referências bibliográficas.
3. Artigos curtos de 5-6 páginas padrão, com páginas adicionais para referências.
Submissões serão revistas por pelos menos 2 revisores.

Links:
Submission site: [https://easychair.org/conferences/?conf=simpletext2021](https://easychair.org/conferences/?conf=simpletext2021)
Modelo de submissão: [https://ceurws.wordpress.com/2020/03/31/ceurws-publishes-ceurart-paper-style/](https://ceurws.wordpress.com/2020/03/31/ceurws-publishes-ceurart-paper-style/)

## Lista de tópicos (não exaustiva)
* Simplificação científica automatizada ou assistida por computador
* Popularização científica automatizada ou assistida por computador
* Síntese automática de textos científicos
* Contextualização, procura de conhecimentos de base
* Extracção de terminologia
* Geração de artigos de jornalismo científico
* Geração de artigos de jornalismo de dados
* Visualização como um método de simplificação
* Métodos de avaliação da complexidade linguística
* Métodos de avaliação da complexidade da informação
* Análise diacrónica da popularização/simplificação
* Estratégia de extensão/simplificação
* Simplificação de texto técnico, pré-edição de texto técnico assistida por computador
* Vigilância tecnológica
* Alteração e distorção da informação científica
* Análise dos limites das tecnologias existentes
* ...

## Comité do Programa
* Liana Ermakova, HCTI - EA 4249, Université de Bretagne Occidentale (Brest, France)
* Eric San-Juan, Laboratoire d’Informatique d’Avignon,Institut de technologie d' Avignon (Avignon, France)
* Josiane Mothe, INSPE, Université de Toulouse, IRIT, UMR5505 CNRS (Toulouse, France)
* Jaap Kamps, Faculty of Humanities, University of Amsterdam (Amsterdam, Netherland)
* Pavel Braslavski, Combinatorial Algebra Lab, Ural Federal University, (Yekaterinburg, Russia)
* Patrice Bellot, Aix-Marseille Université - CNRS (LIS – INS2I) (Marseille, France)
* Irina Ovchinnikova, Institute of Linguistics and Intercultural Communication, Sechenov University (Moscow, Russia)
* Diana Nurbakova, LIRIS, Institut National des Sciences Appliquées de Lyon, (Lyon, France)

## Bibliografia
[1] B. Fecher and S. Friesike, ‘Open science: one term, five schools of thought’, in Opening science, Springer, Cham, 2014, pp. 17–47.
[2] A. Siddharthan, ‘An architecture for a text simplification system’, presented at the Proceedings of the Language Engineering Conference 2002 (LEC 2002), 2002, Accessed: Nov. 20, 2020. [Online]. Available: [http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.1.9968&rank=1](http://citeseerx.ist.psu.edu/viewdoc/summary?doi=10.1.1.1.9968&rank=1).
[3] K. Inui, A. Fujita, T. Takahashi, R. Iida, and T. Iwakura, ‘Text simplification for reading assistance: a project note’, in Proceedings of the second international workshop on Paraphrasing - Volume 16, USA, Jul. 2003, pp. 9–16, doi: 10.3115/1118984.1118986.
[4] E. Hasler, A. de Gispert, F. Stahlberg, A. Waite, and B. Byrne, ‘Source sentence simplification for statistical machine translation’, Comput. Speech Lang., vol. 45, no. C, pp. 221–235, Sep. 2017, doi: 10.1016/j.csl.2016.12.001.
16 changes: 16 additions & 0 deletions clef/pt/Contact.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,16 @@
# SimpleText@CLEF-2022 Contactos

[Início](./) | [Chamada para papéis](./CFP) | [Datas importantes](./dates) | [Tarefas](./tasks) | [Ferramentas](./tools)
[Programa](./program) | [Publicações](./publications) | [Organisadores](./organisers) | [Portefólio](./portefolio) | [<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](../fr/contacts)

---

Website: [http://simpletext-project.com/](http://simpletext-project.com/)

Twitter: [https://twitter.com/SimpletextW](https://twitter.com/SimpletextW)

Google group: [https://groups.google.com/g/simpletext](https://groups.google.com/g/simpletext)

CLEF website: [https://clef2022.clef-initiative.eu/index.php](https://clef2022.clef-initiative.eu/index.php)

Alguma pergunta? Sinta-se à vontade para nos contactar: [contact@simpletext-project.com](mailto:contact@simpletext-project.com)
18 changes: 18 additions & 0 deletions clef/pt/dates.md
Original file line number Diff line number Diff line change
@@ -0,0 +1,18 @@
# SimpleText@CLEF-2022 Datas importantes

[Início](./) | [Chamada para papéis](./CFP) | [Datas importantes](./dates) | [Tarefas](./tasks) | [Ferramentas](./tools)
[Programa](./program) | [Publicações](./publications) | [Organisadores](./organisers) | [Portefólio](./portefolio) | [<img src="https://github.com/simpletext-madics/2021/blob/main/clef/FR.png?raw=true" width="30">](../fr/contacts)

---

* **15 de Novembro 2021:** Abertura de inscrições nos laboratórios
* **15 de Novembro 2021 - 22 Abril 2022:** Campanha de Avaliação
* **22 de Abril de 2022:** O registo nos laboratórios fecha
**6 de Maio de 2022:** Fim do ciclo de avaliação
**27 de Maio de 2022:** Prazo para a apresentação de trabalhos participantes [CEUR-WS]
* **13 Junho 2022:** Notificação de aceitação de trabalhos participantes [CEUR-WS]
* **1 de Julho de 2022:** Data limite para a apresentação de trabalhos de participantes já preparados para a câmara [CEUR-WS]
**18-22 de Julho de 2022:** Previsão das notas de trabalho dos autores [CEUR-WS]
* **5 - 8 Setembro 2022:** Conferência CLEF 2022

Para mais detalhes, clique [aqui].(https://clef2022.clef-initiative.eu/index.php?page=Pages/schedule.html)
Loading