TGTGInsightтелеграм анализLIVE / telegram public index
← Такты, стеки, два колеса

TGINSIGHT SIMILAR POSTS

Намери подобно съдържание

Изходен канал @clockstackwheels · Post #851 · 2.08

Впервые использовал нейросетку для реальной практической пользы в коммерческом заказе. У заказчика есть база данных, куда информация вносится кое-как. Представьте, что вы составляете каталог, например, книг, и в базе данных предусмотрены поля: "Автор книги", "Название книги", "Число страниц" и ещё десяток других полей с информацией. Но заполняют эту базу другие люди, которых вы не контролируете, поэтому информация может случайным образом лежать в любом произвольном поле, быть введена с ошибками, опечатками и так далее. В реальном заказе были не книги, я просто привожу пример такой же задачи. Вот как это может выглядеть: 1. В поле "Автор" написано "Лондон, Дж. Белый Клык", поле "Название" при этом пустое. 2. В поле "Название" написано "150-страничный сборник рецептов", поле "Число страниц" пустое 3. В поле "Название" написано "джеклондон мартин иден", поле с автором пустое 4. В поле "Автор" написано "150-стр.3изд,доп.перераб инструкция по пользованию подстанциями типа ТП-13, М.Васильев москва 98" ...и так далее. А нужно искать нормально по автору, названию, числу страниц, городу и году издания. Никакими прямыми алгоритмами это не берётся: регулярки, поиск по ключевым словам, морфология, нечёткая логика — всё это либо даёт много ложноположительных результатов, либо (если подкрутить пороговые значения) вообще перестаёт искать. И вот тут в какой-то момент мы решили попробовать запрашивать через API GPT. Нейросетке задаётся следующий промт: "Есть следующая информация: «150-страничный роман джеклондон мартин иден». Если здесь есть то, что похоже на имя автора книги, напиши мне его, иначе ответь null". И, надо сказать, даже 3.5 справляется с этой работой очень хорошо. Получилось сравнительно без ошибок разметить около 80% данных (остальные с ошибками даже после нейросетки). Но, важный нюанс. Сначала мы пытались поймать все данные одним запросом: "GPT, выведи мне JSON, в котором есть автор, название, число страниц...", но тесты показали, что значительно эффективнее будет отдельно спросить 5 раз про 5 разных типов данных. Да, это расходует больше токенов, но они и так сравнительно дёшевы. Кстати, API у OpenAI безбожно глючит даже на платном тарифе. Обещанных 3500 запросов в минуту нет даже приблизительно. По факту удаётся отправлять около 200-300 запросов в минуту, потом оно вываливается в таймауты или ошибку 429, нужно делать какие-то умные паузы, ждать итд. Над этим всем пришлось повозиться, зато результат вполне ощутимый. #dev

Hashtags

Резултати

Намерени 5 подобни публикации

Търсене: #docx

当前筛选 #docx清除筛选
油油の科技软件资源分享

@Youyousharechannel · Post #14251 · 22.12.2025 г., 10:16

#PDF#docx#xlsx#文档 😞ImageExtractor,PDF、Word文档、PowerPoint演示文稿、网页链接图片提取工具 一个免费好用的在线图片提取工具,能够帮助我们快速方便地从不同格式的文件中提取图片,像是PDF、Word文档、PowerPoint演示文稿、网页链接,都可以使用这个工具来提取图像 。 它支持多种文件格式:可以从PDF、DOCX、PPTX、XLSX以及网页URL中提取图像。大多数文件的处理时间在60秒以内,只需要输入网页地址,或者是上传文件,然后点击放大镜按钮,接下来等待该工具为我们进行图片提取处理,提取出来的图片会显示在页面上,我们可以根据自己的需要选择保存下载。 无需注册账户或者下载任何工具,只需直接在浏览器中访问,就可以进行图像提取。 🥰https://imageextractor.plus/

Fang的资源分享群

@FLMdongtianfudi · Post #14239 · 29.08.2025 г., 14:03

📚 名称:【学习】AI资料包合集【PDF+MP4+DOCX】【共:1.8G】 ⭐️ 亮点:汇集多种格式的AI学习资料,包括PDF文档、MP4视频与DOCX文件,适合各类学习需求,帮助用户全面掌握AI知识。 🏷 标签:#AI#学习资料#资料包#PDF#MP4#DOCX 👉 链接:https://pan.quark.cn/s/db79042cad1d 🔔Twitter👥频道💬群组

GitHub Trends

@githubtrending · Post #14827 · 12.06.2025 г., 13:30

#typescript#desktop#docx#electron#html#languages#libreoffice#linux#macos#markdown#nodejs#office#offline#pandoc#pdf#productivity#windows#zettlr Zettlr is a free, open-source app that helps you write, organize, and publish your notes and documents using simple Markdown files. It works on Windows, macOS, and Linux, and lets you manage your notes with features like workspaces, tags, and powerful search, so you can quickly find what you need. Zettlr supports easy citations with reference managers like Zotero, offers code highlighting, dark mode, and flexible export options to PDF, Word, or LaTeX, making it ideal for students, researchers, and writers who want a privacy-focused, distraction-free way to work with their ideas and publish their work[1][3][5]. The benefit is that you can focus on your content, not formatting, and easily turn your notes into professional documents. https://github.com/Zettlr/Zettlr

我不是沙雕

@wbssd · Post #136 · 04.11.2023 г., 21:53

#Windows Calibre 电子书管理软件 v6.29 便携版 #Calibre 是一款“一站式”的电子书解决方案,它可以全面满足你的电子书需求;同时它也是一个免费并且开源的电子书一站式软件。他能够跨平台运作, 可支持转换的格式非常丰富,有 #EPUB 、 #MOBI 、 #AZW3 、 #DOCX 、 #HTMLZ 、 #LIT 、 #LRF 、 #PDB 、 #PDF 、 #PMIZ 、 #RB 、 #RTF 、 #TCR 、 #TXT 、 #TXTZ 、 #ZIP 等等。 注意事项 解压到非中文目录运行! 下载地址 https://www.aliyundrive.com/s/N3ViusWvPWh