Logo do projeto Oxossi

SOBRE A PLATAFORMA

O QUE É O OXOSSI?

RESUMO

O projeto Oxossi busca criar uma rede de colaboração para integrar diversos bancos de dados, ferramentas de pesquisa e repositórios de teses, dissertações, livros e artigos acadêmicos sobre diversos períodos da história do Brasil com particular destaque para os períodos colonial e imperial, de modo a favorecer a difusão e inovação no ensino e pesquisa de História. Posteriormente, serão criadas versões destinadas para a história medieval italiana (através da parceria com a Universidade de Pisa) e a história colonial do Uruguai (através da parceria com a Universidade de la Republica). Ele será, ao mesmo tempo, um site de referência em conteúdos e uma ferramenta de buscas elaboradas em condições de permitir a identificação de informações históricas e historiográficas. Por exemplo, todos os autores que pesquisam escravidão no século XIX em alguma região específica e que citaram Caio Prado Júnior. O projeto prevê a criação de uma plataforma online de pesquisa onde o público em geral poderá pesquisar por autores, temas, datas e regiões, além de vasculhar pesquisas acadêmicas e bancos de dados gerados por muitos projetos sobre a história do Brasil (do XVI ao início do XX). O sistema poderá gerar listas de obras a serem consultadas ou ainda textos primários (fontes), tabelas, mapas e gráficos que permitam avançar na pesquisa histórica sobre temas, regiões e períodos de nossa história. Servindo tanto ao público em geral, mas particularmente a professores e pesquisadores das ciências humanas, Oxossi pretende se tornar um grande repositório de pesquisa onde os documentos (tanto seriais, quanto visuais e textuais) serão disponibilizados com uma interface amigável e intuitiva de consulta e produção de material inédito de pesquisa (via o entrecruzamento de fontes). Por último, o projeto visa inovar a forma como é produzida e recepcionada os atos de aprender, produzir e divulgar o conhecimento em História.

ABSTRACT

The Oxossi project seeks to create a collaborative network to integrate various databases, research tools and theses repositories, dissertations, books and academic articles on different periods of Brazilian History, with particular emphasis on the colonial and imperial periods, in order to favour the diffusion and innovation in the teaching and research of History. Subsequently, versions will be created for medieval Italian history (through a partnership with the University of Pisa) and colonial history in Uruguay (through a partnership with the University of the Republic). At the same time, it will be a reference site for content and a search tool designed to identify historical and historiographical information. For example, all authors who researched slavery in the 19th century in a specific region and cited Caio Prado Junior. The project foresees the creation of an online research platform where the general public will be able to search by authors, themes, dates and regions, in addition to searching academic research and databases generated by many projects on the History of Brazil (from the XVI to the beginning of the XX). The system will be able to generate lists of works to be consulted or even primary texts (sources), tables, maps and graphs that advance historical research on themes, regions and periods of our History. Serving both the general public, but particularly professors and researchers in the human sciences, Oxossi intends to become a significant research repository where documents (both serial, visual and textual) will be made available with a friendly and intuitive interface for consultation and production of unpublished research material (via cross- referencing). Finally, the project aims to innovate how learning, producing and disseminating knowledge in History are produced and received.

Como funciona

O Oxóssi lê cada trabalho do acervo para você começar pelo lugar certo

Ele não substitui a leitura. Ele faz antes o trabalho de fichar cada documento, para que a busca seja instantânea. Esta seção explica como essas fichas são feitas, o que elas acertam e onde elas hesitam. Nada aqui é caixa preta.

O que há no acervo

São trabalhos acadêmicos sobre o Brasil colonial e imperial, recolhidos de revistas e de repositórios institucionais. Os de periódico e os de repositório têm fichas diferentes, e essa divisão reaparece adiante:

OrigemDocumentosMetadados típicos
Artigos de periódicoRevista, volume, fascículo, páginas, DOI
Teses e dissertaçõesInstituição, local de defesa, campos extras
Monografias e TCCsInstituição, curso
OutrosLivros, capítulos, relatórios e registros sem tipo

Como as fichas são feitas

Cada PDF passa por seis etapas automáticas. Vamos seguir um documento real por todas elas.

Retórica das lágrimas: sermões e orações fúnebres na Bahia do século XVII.
Valeria Maria Pena Ferreira, UFMG, 2007.

1

Obter o texto

O PDF vira texto corrido. Quando o arquivo é um scan sem camada de texto, e a extração comum não rende nada, entra um reconhecimento óptico com dicionários de português e inglês. O resultado fica guardado, de modo que o trabalho não se repete em execuções futuras.

Cada documento registra de onde veio seu texto:

2

Determinar o período estudado

Esta é a etapa mais cuidadosa do processamento, e vale entender a ordem em que ela trabalha, porque é ela que dá confiabilidade ao filtro de período.

A primeira fonte é o título, porque ali o período é uma afirmação do autor, não uma inferência da máquina. O processamento reconhece três formas de declaração: um intervalo explícito como 1780-1820, um intervalo de séculos, ou um século isolado. No nosso exemplo, o título diz “século XVII”, e o período gravado é 1600 a 1699.

Só quando o título não declara nada é que entra a segunda fonte, estatística: o processamento recolhe os anos citados no texto, calcula onde eles se concentram, e recorta essa faixa pelos anos que de fato ocorrem no documento, para nunca afirmar uma data que não está lá.

E o processamento não esconde qual das duas usou. Cada documento carrega a fonte do período e um grau de confiança, que a plataforma pode exibir e que você pode consultar.

A banda estatística continua registrada, em campos próprios, ao lado do período declarado. As duas respondem perguntas diferentes e por isso convivem: um trabalho anunciado como 1780-1820 cujas datas se concentram em 1795-1812 diz algo sobre a pesquisa que o título não diz. Essa comparação está disponível para quem quiser fazê-la.

Onde conferir

Em alguns documentos o período ficou reduzido a um único ano, em geral porque o título trazia um ano solto, não um intervalo. E nos documentos datados por estatística, a faixa mede onde as datas do texto se concentram, que é parecido com o recorte da pesquisa mas não idêntico. Nos dois casos a confiança registrada é baixa, e é isso que ela está sinalizando.

3

Situar no espaço

O processamento usa uma lista curada de topônimos do período, cada um ligado à sua capitania: Cachoeira e Maragogipe remetem à Bahia, Vila Rica e Sabará a Minas Gerais. É vocabulário histórico montado à mão, não um extrator genérico, e por isso reconhece nomes que já não existem no mapa atual.

Aqui também o título tem prioridade. Se o título nomeia um lugar, ele decide a localização do documento, e as contagens do texto entram apenas como contexto. No nosso exemplo, Bahia venceu por estar no título, e não por aparecer 129 vezes:

Bahia
129 · no título
América portuguesa
121
América
46
Portugal
35
Europa
31

As demais entram como contexto: mostram a escala em que o trabalho se move.

Esse arranjo protege contra um erro comum. Um estudo sobre a Bahia que cite Portugal centenas de vezes continua sendo um estudo sobre a Bahia, e é assim que ele fica catalogado.
4

Classificar o tema

Quatro temas, cada um com um vocabulário de 40 a 50 termos escolhidos à mão. História Social inclui alforria, compadrio, irmandade, exposto; História Econômica inclui sesmarias, monte-mor, cunhagem, dote. O processamento conta as ocorrências de cada vocabulário e o mais pontuado vira o tema principal.

A vantagem desse desenho é ser auditável: dá para abrir a lista e discutir se um termo devia estar em outro tema. E as pontuações de todos os quatro ficam guardadas, não só a do vencedor. É por isso que podemos mostrar exatamente quando a decisão foi apertada.

Nossa tese de exemplo está entre os casos apertados: ficou como História Cultural por 685 pontos contra 684 de História Política. Faz sentido, aliás. Sermões fúnebres na Bahia seiscentista são as duas coisas ao mesmo tempo, e o empate quase perfeito descreve o documento melhor do que qualquer rótulo isolado descreveria.

Como usar

O filtro por tema é excelente para explorar e impreciso para excluir. Se você filtra por História Econômica e um trabalho que deveria estar lá não aparece, vale procurá-lo também em Social: ele pode ter perdido por alguns pontos. Um documento, um tema, e há trabalhos que são genuinamente dois.

5

Extrair a bibliografia

O processamento localiza a lista de referências e separa cada entrada. É isso que sustenta a busca por quem citou quem. Poucas bases brasileiras de história oferecem essa camada.

Cada entrada vira uma linha compacta: sobrenome, título encurtado a cinco palavras, ano. Algo como NOVAIS. Portugal e o Brasil. (1979). Esse formato enxuto é o que permite varrer todas as referências em milissegundos.

Duas limitações conhecidas

Só o sobrenome sobrevive. Ao montar a linha compacta, o processamento guarda o sobrenome e descarta os prenomes. A consequência é que a busca por referências casa sobrenome, não pessoa: procurar por Silva traz trabalhos que citam dezenas de autores diferentes com esse sobrenome. Sobrenomes menos comuns funcionam muito bem. É uma decisão de formato, não uma falha de leitura, e pode ser revertida num reprocessamento.

Parte dos documentos ficou sem bibliografia extraída, em geral porque a lista de referências não foi localizada no PDF. Eles não aparecem em buscas por referências, e a plataforma não avisa que ficaram de fora.

6

Mapear os conceitos centrais

A última etapa é a mais engenhosa. Em vez de contar palavras frequentes, o processamento monta uma rede: dentro de cada frase, os substantivos são ligados entre si, e a rede inteira do documento é submetida ao mesmo algoritmo que ordenava as páginas nos primeiros buscadores. Um conceito ganha peso não por aparecer muito, mas por aparecer junto dos outros conceitos importantes.

Os vinte primeiros colocados entram com peso triplo, os trinta seguintes com peso duplo, os demais com peso simples, e as palavras do título vêm na frente de todos. É esse conjunto que a busca por termo consulta primeiro, e é por isso que ela responde bem a assuntos: ela sabe o que é central no documento, não apenas o que é frequente.

Como a busca usa tudo isso

Quando você digita um termo, o Oxóssi consulta as fichas produzidas por essas seis etapas, guardadas num índice. Por isso a resposta é imediata.

A busca por referências é a única que funciona diferente: percorre as linhas de bibliografia. Quando um documento aparece, a plataforma mostra qual linha casou, para você julgar a correspondência em vez de confiar nela às cegas.

O que esperar

Funciona bem para

  • Descobrir o que existe sobre um assunto e por onde começar a ler.
  • Rastrear a recepção de um autor pelas referências, com a ressalva do sobrenome.
  • Ver como a produção se distribui no tempo, no espaço e por tema.
  • Chegar rápido ao PDF original, que continua sendo a fonte de verdade.
  • Comparar o recorte que um trabalho anuncia com aquele que ele de fato pratica.

Convém confirmar quando

  • Você conclui que algo não existe. Um resultado vazio pode significar isso, ou que aquele documento não teve o campo preenchido. Vale tentar por outro caminho antes de concluir.
  • Você precisa de números que valham como estatística do campo. O acervo é o que foi recolhido dos repositórios, e cresce a cada nova coleta.
  • O documento aparece com confiança de período baixa. O grau está registrado justamente para você saber quando olhar duas vezes.

Em uma frase. O Oxóssi encurta o caminho até os documentos e mostra o quanto confia em cada informação que dá. Use-o para chegar mais rápido ao que interessa, e abra os PDFs para o que vier depois.

Os números desta seção são calculados sobre a base completa e estão sendo carregados.