Em informática e ciência da informação, o modelo de independência binária (BIM, do inglês binary independence model) é uma técnica probabilística de recuperação de informação. O modelo faz algumas suposições simples para tornar a estimativa de semelhança entre documento/consulta provável e viável.
Definições A suposição de independência binária estabelece que os documentos são vetores binários; ou seja, apenas a presença ou ausência de termos nos documentos é registada. Os termos são distribuídos de forma independente no conjunto de documentos relevantes e são também distribuídos independentemente no conjunto de documentos irrelevantes. A representação é um conjunto ordenado de variáveis booleanas. Isto significa que a representação de um documento ou consulta é um vetor com um elemento booleano para cada termo em consideração. Mais especificamente, um documento é representado por um vetor d = (x1, ..., xm) onde xt=1 se o termo t estiver presente no documento d e xt=0 caso contrário. Muitos documentos podem ter a mesma representação vetorial com esta simplificação. As consultas são representadas de forma semelhante. "Independência" significa que os termos no documento são considerados independentemente uns dos outros e nenhuma associação entre termos é modelada. Esta suposição é muito limitadora, mas foi demonstrado que produz resultados suficientemente bons para muitas situações. Esta independência é a suposição "ingénua" de um Classificador Naive Bayes, onde propriedades que se implicam mutuamente são, apesar disso, tratadas como independentes por uma questão de simplicidade. Esta suposição permite que a representação seja tratada como uma instância de um Modelo de espaço vetorial, considerando cada termo como um valor de 0 ou 1 ao longo de uma dimensão ortogonal às dimensões usadas para os outros termos. A probabilidade
P ( R
|
d , q )
{\displaystyle P(R|d,q)}
de que um documento seja relevante deriva da probabilidade de relevância do vetor de termos desse documento
P ( R
|
x , q )
{\displaystyle P(R|x,q)}
. Utilizando a Regra de Bayes, obtemos:
P ( R
|
x , q ) =
P ( x
|
R , q ) ∗ P ( R
|
q )
P ( x
|
q )
{\displaystyle P(R|x,q)={\frac {P(x|R,q)*P(R|q)}{P(x|q)}}}
onde
P ( x
|
R = 1 , q )
{\displaystyle P(x|R=1,q)}
e
P ( x
|
R = 0 , q )
{\displaystyle P(x|R=0,q)}
são as probabilidades de recuperar um documento relevante ou não relevante, respetivamente, dado que a representação desse documento é x. As probabilidades exatas não podem ser conhecidas de antemão, pelo que devem ser utilizadas estimativas estatísticas sobre a coleção de documentos.
P ( R = 1
|
q )
{\displaystyle P(R=1|q)}
e
P ( R = 0
|
q )
{\displaystyle P(R=0|q)}
indicam a probabilidade a priori de recuperar um documento relevante ou não relevante, respetivamente, para uma consulta q. Se, por exemplo, soubéssemos a percentagem de documentos relevantes na coleção, poderíamos usá-la para estimar estas probabilidades. Visto que um documento é ou relevante ou não relevante para uma consulta, temos que:
P ( R = 1
|
x , q ) + P ( R = 0
|
x , q ) = 1
{\displaystyle P(R=1|x,q)+P(R=0|x,q)=1}
Ponderação de Termos de Consulta Dada uma consulta binária e o produto escalar como função de semelhança entre um documento e uma consulta, o problema reside em atribuir pesos aos termos na consulta de modo a que a eficácia da recuperação seja elevada. Sejam pi e qi a probabilidade de um documento relevante e um documento irrelevante possuírem o i-ésimo termo, respetivamente. Yu e Salton, que introduziram o BIM pela primeira vez, propõem que o peso do i-ésimo termo seja uma função crescente de
Y
i
=
p
i
∗ ( 1 −
q
i
)
( 1 −
p
i
) ∗
q
i
{\displaystyle Y_{i}={\frac {p_{i}*(1-q_{i})}{(1-p_{i})*q_{i}}}}
. Assim, se Yi for superior a Yj, o peso do termo i será superior ao do termo j. Yu e Salton demonstraram que tal atribuição de pesos aos termos da consulta resulta numa melhor eficácia de recuperação do que se os termos tivessem pesos iguais. Robertson e Spärck Jones demonstraram posteriormente que, se ao i-ésimo termo for atribuído o peso de
log
Y
i
{\displaystyle \log Y_{i}}
, obtém-se a eficácia de recuperação ideal sob a suposição de independência binária. O modelo de independência binária foi introduzido por Yu e Salton. O termo modelo de independência binária (BIM) foi cunhado por Robertson e Spärck Jones, que utilizaram a probabilidade log-odds do modelo de relevância probabilística para derivar
log
Y
i
{\displaystyle \log Y_{i}}
, onde a probabilidade log-odds demonstra ser equivalente em termos de ordenação (ranking) à probabilidade de relevância (ou seja,
P ( R
|
d , q )
{\displaystyle P(R|d,q)}
) por Luk, obedecendo ao princípio de ordenação por probabilidade.
Ver também Modelo de saco de palavras (Bag of words model)
Leitura adicional Christopher D. Manning; Prabhakar Raghavan; Hinrich Schütze (2008), Introduction to Information Retrieval, Cambridge University Press Stefan Büttcher; Charles L. A. Clarke; Gordon V. Cormack (2010), Information Retrieval: Implementing and Evaluating Search Engines, MIT Press
Referências

