Поддерживаемые типы файлов для извлечения текста

Cloud Search индексирует все отправляемые элементы, независимо от типа файла (MIME или content-type). Индексирование выполняется на основе метаданных файла и, если это поддерживается, его содержимого. Ниже приведен список типов файлов, для которых поддерживается индексирование содержимого.

  • Microsoft Word (DOC)
  • Microsoft Word (DOCX)
  • Microsoft Excel (XLS)
  • Microsoft Excel (XLSX)
  • Microsoft PowerPoint (PPT)
  • Microsoft PowerPoint (PPTX)
  • Портативный формат документов (PDF) от Adobe
  • Формат форматированного текста (RTF)
  • Текстовый формат (TXT)
  • Язык разметки гипертекста (HTML)
  • Расширяемый язык разметки (XML)

In addition to these file types, Cloud Search supports indexing of content within any plain text file.

Optical Character Recognition (OCR) file types and characteristics

Google Cloud Search also uses OCR to extract text from the following file types:

Тип файла Максимальный размер
Объединенная группа экспертов в области фотографии (JPG) 10 МБ
Графический формат обмена файлами (GIF) 10 МБ
Формат файла изображения с тегами (TIFF) 10 МБ
Масштабируемая векторная графика (SVG) 10 МБ
Формат изображений PostScript (PS) 10 МБ
Формат портативного документа (PDF) 30 МБ

OCR also works on files with these characteristics:

  • Hand-written documents. Documents in Latin script, Japanese, and Korean yield the best results.
  • Vertically-written documents, such as those in Japanese.
  • Документы, написанные справа налево, например, на иврите.