Sitemaps - Code Search

fess-crawler/src/main/java/org/codelibs/fess/crawler/CrawlerThread.java

    }

    /**
     * Adds sitemaps from robots.txt to the crawling queue.
     * @param urlQueue The URL queue to add sitemaps to.
     */
    protected void addSitemapsFromRobotsTxt(final UrlQueue<?> urlQueue) {
        final String[] sitemaps = crawlerContext.removeSitemaps();
        if (sitemaps != null) {
            for (final String childUrl : sitemaps) {
                try {

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Thu Aug 07 02:55:08 UTC 2025

- 20.4K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler/src/main/java/org/codelibs/fess/crawler/exception/SitemapsException.java

 * either express or implied. See the License for the specific language
 * governing permissions and limitations under the License.
 */
package org.codelibs.fess.crawler.exception;

/**
 * Exception thrown during sitemaps processing in the crawler.
 * This exception extends {@link org.codelibs.fess.crawler.exception.CrawlerSystemException}
 * and provides constructors for wrapping other exceptions or creating a new exception with a message.
 */

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Sun Jul 06 02:13:03 UTC 2025

- 1.7K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler-lasta/src/main/resources/crawler.xml

	<include path="crawler/extractor.xml"/>
	<include path="crawler/mimetype.xml"/>
	<include path="crawler/encoding.xml"/>
	<include path="crawler/urlconverter.xml"/>
	<include path="crawler/log.xml"/>
	<include path="crawler/sitemaps.xml"/>

	<!-- Crawler -->
	<component name="crawler" class="org.codelibs.fess.crawler.Crawler" instance="prototype" >
	</component>

	<!-- Crawler Thread -->

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Tue Nov 28 13:40:25 UTC 2017

- 1.7K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler-opensearch/src/main/resources/crawler_opensearch.xml

    <include path="crawler/mimetype.xml"/>
    <include path="crawler/encoding.xml"/>
    <include path="crawler/urlconverter.xml"/>
    <include path="crawler/log.xml"/>
    <include path="crawler/sitemaps.xml"/>

    <include path="crawler/opensearch.xml"/>

	<!-- Crawler -->
	<component name="crawler" class="org.codelibs.fess.crawler.Crawler" instance="prototype" >
	</component>

	<!-- Crawler Thread -->

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Thu Nov 07 04:44:10 UTC 2024

- 2.2K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler-lasta/src/test/java/org/codelibs/fess/crawler/CrawlerTest.java

            file.delete();
            file.mkdirs();
            file.deleteOnExit();
            fileTransformer.setPath(file.getAbsolutePath());
            crawler.addUrl(url + "sitemaps.xml");
            crawler.crawlerContext.setMaxAccessCount(maxCount);
            crawler.crawlerContext.setNumOfThread(numOfThread);
            crawler.urlFilter.addInclude(url + ".*");

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Sat Sep 06 04:15:37 UTC 2025

- 12.8K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler/src/test/java/org/codelibs/fess/crawler/CrawlerTest.java

            file.delete();
            file.mkdirs();
            file.deleteOnExit();
            fileTransformer.setPath(file.getAbsolutePath());
            crawler.addUrl(url + "sitemaps.xml");
            crawler.crawlerContext.setMaxAccessCount(maxCount);
            crawler.crawlerContext.setNumOfThread(numOfThread);
            crawler.urlFilter.addInclude(url + ".*");

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Tue Nov 11 13:40:14 UTC 2025

- 25.8K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler/src/main/java/org/codelibs/fess/crawler/entity/RobotsTxt.java

    }

    /**
     * Adds a sitemap URL to the list of sitemaps.
     *
     * @param url The URL of the sitemap to be added
     */
    public void addSitemap(final String url) {
        if (!sitemapList.contains(url)) {
            sitemapList.add(url);
        }
    }

    /**
     * Returns an array of sitemap URLs.
     *
     * @return an array of sitemap URLs
     */

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Mon Nov 24 03:59:47 UTC 2025

- 18.5K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

CLAUDE.md

extractorFactory.addExtractor("text/html", tikaExtractor, 1);  // Fallback
```

### Helpers

**RobotsTxtHelper**: RFC 9309 parsing, user-agent matching, crawl-delay, sitemaps
**SitemapsHelper**: Sitemap XML parsing, index handling
**MimeTypeHelper**: MIME detection via Tika
**EncodingHelper**: Charset detection with BOM
**UrlConvertHelper**: URL normalization

---

## Development Workflow

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Fri Nov 28 17:31:34 UTC 2025

- 10.7K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler/src/main/java/org/codelibs/fess/crawler/client/http/HcHttpClient.java

                    if (robotsTxt != null) {
                        final String[] sitemaps = robotsTxt.getSitemaps();
                        if (sitemaps.length > 0) {
                            crawlerContext.addSitemaps(sitemaps);
                        }

                        final RobotsTxt.Directive directive = robotsTxt.getMatchedDirective(userAgent);

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Sun Nov 23 12:19:14 UTC 2025

- 53.7K bytes

- Viewed (0)

github.com/codelibs/fess-crawler

fess-crawler/src/test/java/org/codelibs/fess/crawler/processor/impl/SitemapsResponseProcessorTest.java

        // Test handling of duplicate URLs in sitemap
        ResponseData responseData = new ResponseData();
        byte[] content = "<sitemap></sitemap>".getBytes();
        responseData.setResponseBody(content);

        SitemapUrl sitemap1 = new SitemapUrl();
        sitemap1.setLoc("https://example.com/duplicate");

        SitemapUrl sitemap2 = new SitemapUrl();
        sitemap2.setLoc("https://example.com/duplicate");

Registered: Sat Dec 20 11:21:39 UTC 2025

- Last Modified: Thu Nov 13 13:29:22 UTC 2025

- 12K bytes

- Viewed (0)

Search Options