я знаю, тут спецы по lucene есть
подскажите где можно творчески позаимствовать готовую к использованию конфигурацию solr для немецкого? я знаю что в природе есть словари от open office, списки стоп слов и т.д... не хочется велосипед изобретать...
sol/lucene на немецком
-
Гость
Re: sol/lucene на немецком
ну вот что то нашел, но думаю есть более детально...
http://www.typo3-media.com/blog/solr-no ... nsion.html" onclick="window.open(this.href);return false;
тексты в основном около-IT шные, может быть смешанная английско-немецкая терминология
http://www.typo3-media.com/blog/solr-no ... nsion.html" onclick="window.open(this.href);return false;
тексты в основном около-IT шные, может быть смешанная английско-немецкая терминология
-
Гость
Re: sol/lucene на немецком
из разных источников было собрано что то вроде этого, ругайте.
"german-common-nouns.txt" был взят из статьи по ссылке и ничо так. но думаю если сгенерить из словаря то будет лучше. проблема только в том что в этот
файл должны попать только несоставные существительные, кажется в словаре такой информации нету...
"german-common-nouns.txt" был взят из статьи по ссылке и ничо так. но думаю если сгенерить из словаря то будет лучше. проблема только в том что в этот
файл должны попать только несоставные существительные, кажется в словаре такой информации нету...
Код: Выделить всё
<fieldType name="text" class="solr.TextField" positionIncrementGap="100">
<analyzer type="index">
<tokenizer class="solr.WhitespaceTokenizerFactory"/>
<filter class="solr.StopFilterFactory"
ignoreCase="true"
words="stopwords_de.txt"
enablePositionIncrements="true"
/>
<filter class="solr.WordDelimiterFilterFactory"
generateWordParts="1"
generateNumberParts="1"
splitOnCaseChange="1"
splitOnNumerics="1"
catenateWords="1"
catenateNumbers="1"
catenateAll="0"
preserveOriginal="1"
/>
<filter class="solr.LowerCaseFilterFactory"/>
<filter class="solr.DictionaryCompoundWordTokenFilterFactory" dictionary="german-common-nouns.txt"
minWordSize="5" minSubwordSize="4" maxSubwordSize="15" onlyLongestMatch="true"/>
<filter class="solr.RemoveDuplicatesTokenFilterFactory" />
<filter class="solr.HunspellStemFilterFactory"
dictionary="de_DE_frami.dic"
affix="de_DE_frami.aff"
ignoreCase="true"
/>
</analyzer>
<analyzer type="query">
<tokenizer class="solr.WhitespaceTokenizerFactory"/>
<!--
<filter class="solr.SynonymFilterFactory" synonyms="synonyms.txt" ignoreCase="true" expand="true"/>
-->
<filter class="solr.StopFilterFactory"
ignoreCase="true"
words="stopwords_de.txt"
enablePositionIncrements="true"
/>
<filter class="solr.WordDelimiterFilterFactory"
generateWordParts="1"
generateNumberParts="1"
catenateWords="0"
catenateNumbers="0"
catenateAll="0"
splitOnCaseChange="1"
/>
<filter class="solr.LowerCaseFilterFactory"/>
<filter class="solr.DictionaryCompoundWordTokenFilterFactory" dictionary="german-common-nouns.txt"
minWordSize="5" minSubwordSize="4" maxSubwordSize="15" onlyLongestMatch="true"/>
<filter class="solr.RemoveDuplicatesTokenFilterFactory" />
<filter class="solr.HunspellStemFilterFactory"
dictionary="de_DE_frami.dic"
affix="de_DE_frami.aff"
ignoreCase="true"
/>
</analyzer>
</fieldType>