Зачем я полез с накладными в Claude 3.5 Sonnet
Павел Дронов, хозяин торговой точки. Задачу оцифровки бумажных накладных и чеков я решал без иллюзий про полную автоматизацию. У меня есть пачка мятых бумажек от поставщиков, где вместо нормального ЭДО часто приносят блеклые ленты из принтера или заполненные от руки бланки.
Обычные коробочные OCR-системы на таких документах стабильно ломаются, а отдавать бухгалтеру ручной ввод — это постоянные перепроверки. Решил проверить, как с этой рутиной справляется Claude 3.5 Sonnet через веб-интерфейс и API, опираясь на официальные спецификации модели и фактический прогон документов.
- Входные данные: 50 сканов и фото чеков и накладных за неделю.
- Форматы: PDF, JPEG, PNG разного качества (от четких сканов до фото с телефона на ходу).
- Цель: вытащить позиции, количество, цены и общую сумму в CSV или JSON для учета.
Во сколько обошелся тест по API и через веб
Если считать затраты по текущим тарифам Anthropic для Claude 3.5 Sonnet (3 доллара за миллион входных токенов и 15 долларов за миллион выходных), обработка одного среднего документа с изображением обходится примерно в полтора-два цента.
За тестовую пачку из 50 документов вышло около доллара по API. Через веб-интерфейс (Claude Pro за 20 долларов в месяц) это вообще входит в абонентку, но там упираешься в лимиты на отправку картинок, если кидать их пачками. Короче, железо и подписки съедают вполне подъемные деньги, вопрос только в том, какого качества получается результат.
- Стоимость входного токена API: $3.00 / MTokens.
- Стоимость выходного токена API: $15.00 / MTokens.
- Подписка Claude Pro: $20 / месяц с ограничениями по количеству сообщений.
Как проходил тест: методика и ограничения
Я загружал документы по одному и пакетно, требуя от модели выдать табличные данные по строкам: наименование товара, фасовка, количество, цена за единицу и итоговая сумма. Никаких сложных промптов не использовал, только жесткий системный запрос с требованием не придумывать данные, а ставить null, если цифру не разобрать.
Сразу оговорюсь: это не лабораторное исследование с тысячами образцов, а полевой тест владельца одной розничной точки на реальной «боевой» макулатуре, которую мне привезли поставщики за последние дни.
- Методика: слепое сравнение того, что напечатал ИИ, с тем, что реально забито в товарной накладной.
- Ограничение: рукописные исправления шариковой ручкой модель видит через раз, особенно если они сделаны поверх текста.
Где Claude 3.5 Sonnet безупречна, а где ошибается
С четкими печатными накладными в формате PDF модель справляется на отлично. Названия товаров, даже с сокращениями вроде «Торт Наполеон 0.5кг м/у», распознает корректно и аккуратно раскладывает по колонкам. Проблемы начинаются там, где человек видит контекст, а нейросеть смотрит на пиксели.
Главная беда — путаница в цифрах при плохом освещении или замятии бумаги. На термолентах часто слипаются нули и шестерки, а запятые превращаются в точки или вообще теряются. Если в чеке стоит сумма 1250.00, модель может выдать 125.00, пропустив ноль в разряде, если там был слабый оттиск принтера.
- Сильные стороны: отличный парсинг табличной структуры, понимание сокращений в номенклатуре, нормальный экспорт в JSON.
- Слабые места: затертые термочеки, ручные правки поверх печати, путаница в разрядах чисел при смазанном шрифте.
Типичные ошибки в цифрах и почему они опасны
В четырех документах из пятидесяти модель выдала «галлюцинации» по суммам: посчитала итоговую строку сама, проигнорировав реальную цифру внизу чека, либо сложила позиции с ошибкой в копейках из-за округления НДС.
Для розничного учета такая ошибка на копейках не критична, но если выгружать это напрямую в складскую программу без проверки глазами, остатки рано или поздно разъедутся. Автоматика экономит время на набивку, но снимать ответственность с человека пока рано.
- Ошибка №1: замена цифр в номерах партий и штрихкодах из-за дефектов печати.
- Ошибка №2: расхождение итоговой суммы накладной и суммы строк при неполном распознавании.
- Ошибка №3: игнорирование позиций со скидками, оформленных мелким шрифтом внизу.
Итог: стоит ли внедрять нейросеть в учет
Использовать Claude 3.5 Sonnet для первичного разбора документов можно и нужно, если у вас нет бюджета на внедрение тяжелого энтерпрайз-OCR. Она быстро переводит мутную пачку сканов в структурированный текст, с которым уже может работать человек.
Но пускать этот процесс на полную автономию без валидации нельзя. Я оставил скрипт для первичной подготовки данных, но каждый документ перед отправкой в товароучетку по-прежнему просматривает оператор. Это бережет нервы и деньги от сюрпризов в инвентаризации.
- Кому подходит: малому бизнесу с небольшим объемом разнородных бумажных документов.
- Безопасный откат: при обнаружении сбоев в парсинге всегда сверять документ по исходному изображению в интерфейсе.
Источники
Anthropic Claude 3.5 Sonnet Model Card and Capabilities: https://www.anthropic.com/news/claude-3-5-sonnetAnthropic API Pricing: https://www.anthropic.com/pricing