TGTGInsighttelegram intelligenceLIVE / telegram public index
← GitHub Trends

TGINSIGHT SIMILAR POSTS

Find similar content

Source channel @githubtrending · Post #15573 · Mar 19

#java#a11y#accessibility#ai#bounding_box#document_parsing#eaa#html#json#markdown#ocr#ocr_recognition#pdf#pdf_accessibility#pdf_converter#pdf_extraction#pdf_parser#pdf_ua#rag#tables#tagged_pdf OpenDataLoader PDF is a free, open-source tool (Apache 2.0) that tops benchmarks with 0.90 accuracy for extracting structured data like Markdown, JSON (with bounding boxes), and HTML from any PDF—digital, scanned, or complex with tables, formulas, charts, and OCR in 80+ languages. It runs locally on CPU (0.05s/page fast mode), filters AI prompt injections for safety, integrates with LangChain/RAG, and automates accessibility tagging to Tagged PDF. You save time and costs on parsing for AI pipelines or compliance (vs. $50–200/manual doc), getting precise, private results for better LLM apps and legal standards. https://github.com/opendataloader-project/opendataloader-pdf

Results

1 similar post found

Search: #textanalysis

当前筛选 #textanalysis清除筛选
Data Science Jobs

@datasciencejobs · Post #2363 · 10/11/2024, 09:00 AM

#NLP#ML#AI#NaturalLanguageProcessing#DeepLearning#Python#УдаленнаяРабота#ИП#LLM#TextAnalysis Вакансия: ML/NLP разработчик Грейд: Middle+/Senior Локация: строго РФ Формат работы: удалённая, трудоустройство только по ИП Зарплата: 250-350 тыс. руб. 💸 📌О проекте: Мы разрабатываем интеллектуальную Систему анализа проектной документации для обработки и анализа текстовых данных. В рамках проекта вы будете участвовать в создании когнитивного поиска, рекомендательных систем и digital-ассистентов, помогая реализовать передовые решения на основе естественного языка. 📌Задачи: - Разработка моделей для структурирования текстов и понимания запросов на естественном языке 🧠 - Решение NLP задач для когнитивного поиска и рекомендательных систем - Разработка NLU моделей для digital-ассистентов - Развитие и оптимизация больших языковых моделей (LLM) 📌Мы предлагаем: - Удалённую работу с гибким графиком 🏡 - Трудоустройство по ИП с прозрачными условиями - Участие в интересных проектах по текстовому анализу - Возможности для профессионального роста 🚀 - Работа с передовыми технологиями и решениями 📌Наши ожидания: - Опыт работы с NLP задачами от 3 лет - Глубокие знания машинного обучения и deep learning в NLP - Практический опыт работы с задачами для русского языка: классификация текста, topic modeling, NER, Text2SQL - Участие в хакатонах или Kaggle будет плюсом 🏆 📌Технологический стек: Python, NLTK, DeepPavlov, Hugging Face, LSH, faiss, nmslib, HNSW, Spark, Pandas, Numpy, Sklearn, Keras, PyTorch, Tensorflow, RNN, CNN, Transformer, BERT. 📌Преимуществом будет: - Опыт работы с LLM, включая RAG, LangChain, LoRA - Навыки fine-tuning и prompt engineering Если хотите присоединиться к нашему проекту, пишите в Telegram: @BekhterevaElena.