doc2md: пачка документов в чистый Markdown до того, как её прочитает агент
Word, Excel, PowerPoint, PDF, EPUB, RTF и CSV проходят через один конвертер и выходят одинаковым GitHub-Flavored Markdown. Открытый код, лицензия MIT.
Зачем
ИИ-агент читает каждый формат своим отдельным ридером. На пачке из пятнадцати договоров это пятнадцать вызовов инструмента, пятнадцать непохожих дампов и заметный расход токенов на построчное чтение. После doc2md на диске лежат пятнадцать .md в одном формате, и дальше агент работает по ним обычным поиском.
Одна команда
npx skills add ilyautov/doc2md
Дальше конвертер принимает один файл, список путей или папку целиком, рекурсивно:
node convert.js ~/договоры/
На выходе сводка построчно: OK, ПРОПУСК или ОШИБКА по каждому файлу. Молчаливых пропусков нет, иначе потерянный документ замечают через неделю.
Чего он не делает
Это не замена штатным скиллам docx, pdf, xlsx и pptx. Если нужно отредактировать один файл, сохранить форматирование или вытащить из него картинки, берите их. doc2md нужен ровно для случая «прочитать содержимое пачки и дальше с ней работать», особенно когда форматы смешанные.
Кому пригодилось
Бухгалтерии, отделу кадров и юристам на проверке контрагента: у всех периодически скапливаются папки разноформатных документов, которые надо превратить в текст, в том числе чтобы отдать той же нейросети.