Urgent.News

What's breaking now, across thousands of outlets.

Tech

O dicionário que corrige acento errado sozinho

Um script meu corrige acentuação automática em português usando um dicionário de mais de noventa mil palavras. Ele existe justamente para consertar texto gerado por IA, que às vezes esquece acento. Só que hoje descobri que o próprio dicionário estava trocando "pele" por "Pelé" e "teve" por "tevê". O corretor não tinha bug de lógica nenhum. O dado dentro dele é que estava errado. Como um…

Uma ferramenta que corrige acentuação em português foi descoberta com um bug, confundindo acentos errados com acentos corretos. O script, criado por Nayara Martins, usa um dicionário de mais de noventa mil palavras para corrigir textos gerados por IA. No entanto, o dicionário sofreu um problema ao tentar mapear acentos para palavras que também são nomes próprios, como "Pele" e "teve".

O dicionário, gerado a partir de uma lista ampla de palavras em português, mapeia a forma sem acento para a forma com acento correspondente. Mas para palavras que também são nomes próprios, como "Pele" e "teve", o dicionário tem dificuldade em escolher o acento correto, já que a forma comum, sem acento, é muito mais frequente no uso real.

O problema se torna mais perigoso quando um erro de dicionário não é imediatamente visível. O texto resultante ainda parece fluente e gramaticalmente correto, sem sinais de que uma palavra foi trocada por engano. A única forma de detectar o erro é ler o texto gerado com atenção, palavra por palavra, depois de já ter aplicado o corretor automático.

A correção certa consiste em remover a entrada errada do dicionário, caso ela esteja causando um bug verdadeiro. No entanto, em casos de ambiguidade real, como a palavra "e" (conjunção ou verbo) ou "esta" (demonstrativo ou verbo), o dicionário não pode resolver automaticamente. Portanto, é necessário documentar as palavras que exigem leitura humana antes de publicar qualquer texto gerado.

Written by urgent.news from Dev.to's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.

Read the original at dev.to →

More in Tech

O bug que corrige sozinho o arquivo, mas não o e-mail que ele gera

Um sistema meu estava mandando e-mail em português com acentuação errada. Não era acento faltando, era acento trocado : "operação" virava "operação" em alguns lugares e simplesmente sumia em outros.

  • Portuguese system sent emails with incorrect accentuation.
  • Bug appeared in final output, not in CSV file.
  • Solution was to change encoding from Latin-1 to UTF-8.

A versão de API que vence sem avisar

Um script meu que publicava conteúdo via API do LinkedIn parou de funcionar do nada. Nenhuma linha mudou. O erro voltou assim: { "status" : 426 , "code" : "NONEXISTENT_VERSION" , "message"…

  • LinkedIn API versioning by date has deactivated the used version.
  • API REST requires LinkedIn-Version header in YYYYMM format.
  • Updating header value to latest version resolves the issue.

Nginx Load Balancing with DNS-Based Service Discovery on Incus

Nginx Load Balancing with DNS-Based Service Discovery on Incus Hari ini saya buat satu practical lab untuk memahami Nginx Load Balancing , DNS-based Service Discovery , dan operational logging dalam…

  • Implement Nginx Load Balancing with DNS-Based Service Discovery on Incus
  • Use dnsmasq as DNS server, Nginx LB resolves hostnames via DNS
  • Adding web03 easy, no Nginx config change needed

More from Sunday 30 August →