Що асистент бачить у договорі
Чернетка. Текст і кадри ще вичитуються і можуть змінитися.
Асистент читає не файл, а текст, який із цього файла дістала програма.
Версія для телефона: на весь екран
Спершу варто подивитись:
- Звідки береться відповідь · Як працює мовна модель · близько 5 хв
Текстом
Те саме, що у фільмах: кожен кадр і його текст. Текст можна скопіювати і дати своєму асистентові разом із власним питанням.
Що асистент бачить у договорі
Договір поставки надходить файлом, і людина додає його до розмови з асистентом, щоб той оцінив умови. Сучасний асистент читає договір цілком, проте читає він не сам файл, а текст, який із файла дістали. Фільм показує, яким цей текст виходить із файла Word, із PDF і зі скану, що в нього не потрапляє і як за хвилину переконатися, що асистент прочитав саме той договір.
Текст із файла дістає не модель. Мовна модель, яка складає відповіді, приймає тільки текст, тому продукт, тобто програма, в якій працює асистент, спершу розгортає файл: відкриває його і виписує вміст рядок за рядком. Сторінку такою, як її бачить людина, модель здебільшого не отримує. Що саме вдасться виписати, залежить від формату, тож той самий договір у трьох форматах дає три різні тексти.
Найповніший текст виходить із файла Word, бо він і всередині є текстом із розміткою: редактор позначає в ньому, де заголовок розділу, де нумерований пункт, де клітинка таблиці. Програма переносить це без втрат, і модель отримує розділи в тому самому порядку і з тими самими номерами. Пункт 3.1 про аванс 120 000,00 грн протягом 5 банківських днів доходить до неї слово в слово.
Проте у файлі Word лежить більше, ніж видно на сторінці. Після роботи в режимі виправлень редактор зберігає в ньому видалений текст і коментарі на полях: тут у пункті 3.1 строк 10 днів замінили на 5 і запитали, чи не забагато 40 %. Одні продукти передають моделі лише остаточний текст, інші додають видалене й коментарі, тож в пункті стоять два строки поруч. Тому правки перед завантаженням приймають або відхиляють.
У PDF розмітки вже немає: такий файл зберігає кожен шматок тексту разом із його місцем на аркуші, але не позначає, де абзац і де клітинка таблиці. Програма збирає рядки за координатами, і суцільний текст виходить добре. Таблицю ж вона може прочитати стовпцями, і тоді суми стоять окремо від слів «аванс» і «залишок». Котру суму до якого рядка віднести, модель вирішує сама і в складній таблиці може помилитися.
Скан теж часто зберігають як PDF, але всередині немає жодної літери, тільки знімок аркуша. Літери на ньому впізнає програма розпізнавання тексту, а в деяких продуктах сама модель, якщо вона вміє читати зображення. Схожі знаки при цьому плутаються, найчастіше цифри: під печаткою програма прочитала 180 000,00 як 130 000,00. Розпізнаний текст такий самий рівний, як текст із Word, і помилки в ньому не видно.
Частина договору в текст не потрапляє за жодного формату. Печатка й підпис є зображеннями, тому з тексту не видно, чи договір підписано. Пункт 1.2 згадує Додаток 1 зі специфікацією, але файла з ним не додали. Дуже довгий документ продукт може передати не цілим. Про ці прогалини модель повідомляє не завжди: відповідь вона складає з того тексту, який має, і звучить та так само впевнено.
Що саме дійшло до моделі, зʼясовують до аналізу, двома проханнями: перелічити розділи з номерами і згадані в тексті додатки та дослівно процитувати один пункт із цифрами, наприклад 3.1. Відповідь звіряють із файлом: девʼять розділів на місці, цитата збігається до знака, а про Додаток 1 асистент пише, що файла з ним немає. Коли розділу бракує або цифра інша, спершу виправляють файл, а не запит.
Далі
- Контекст збирає людина · чернетка · Договір як дані · близько 5 хв