| Versão | 1.0 |
|---|---|
| Editor | Luigi Rosa |
| Data de lançamento | 19 de nov. de 2012 |
| Data adicionada | 19 de nov. de 2012 |
| Os requisitos | Windows 2003, Windows Vista, Windows 98, Windows Me, Windows, Windows NT, Windows 2000, Windows 8, Windows Server 2008, Windows 7, Windows XP |
| Requisitos | Matlab |
| Total de downloads | 691 |
| Downloads por semana | 1 |
| Preço | Free |
Descrição
O reconhecimento óptico de caracteres (OCR) é a tradução de bitmaps digitalizados opticamente de caracteres de texto impressos ou escritos em códigos de caracteres, como ASCII. Essa é uma maneira eficiente de transformar materiais impressos em arquivos de dados que podem ser editados e manipulados em um computador. Essa é a tecnologia há muito usada por bibliotecas e agências governamentais para disponibilizar rapidamente documentos extensos eletronicamente. Os avanços na tecnologia OCR estimularam seu uso crescente pelas empresas. Para muitas tarefas de entrada de documentos, o OCR é o método mais rápido e econômico disponível. E a cada ano, a tecnologia libera hectares de espaço de armazenamento antes destinados a armários de arquivo e caixas cheias de documentos em papel. Antes que o OCR possa ser usado, o material de origem deve ser escaneado usando um scanner óptico (e às vezes uma placa de circuito especializada no PC) para ler a página como um bitmap (um padrão de pontos). Também é necessário um software para reconhecer as imagens.
Nosso pacote de software propõe resolver a classificação de caracteres manuscritos isolados e dígitos do conjunto de dados de caracteres da caneta UJI usando redes neurais. Os dados consistem em amostras de 26 caracteres e 10 dígitos escritos por 11 escritores em um tablet PC. Os caracteres (no formato padrão UNIPEN) são escritos em maiúsculas e minúsculas e há um conjunto completo de dois caracteres por escritor. Portanto, a saída deve estar em uma das 35 classes. O objetivo final é construir um modelo independente de escritor para cada personagem.
A seleção de recursos valiosos é crucial no reconhecimento de caracteres, portanto, um novo e significativo conjunto de recursos, o Uniform Differential Normalized Coordinates (UDNC), introduzido por C. Agell, é adotado. Esses recursos são mostrados para melhorar a taxa de reconhecimento usando algoritmos de classificação simples para que sejam usados para treinar uma rede neural e testar seu desempenho no conjunto de dados de caracteres da caneta UJI.
Termos de indexação: Matlab, fonte, código, ocr, reconhecimento óptico de caracteres, texto digitalizado, texto escrito, ascii, caractere isolado.