TGTGInsighttelegram intelligenceLIVE / telegram public index
← Python Заметки

TGINSIGHT SIMILAR POSTS

Најди сличен содржај

Изворен канал @pythonotes · Post #121 · 20 јул.

Регулярно требуется преобразовать какой-либо текст в максимально совместимый текст для URL, имени файла, имени объекта в каком-то софте и тд. Требования совместимости простые: в тексте должны быть только допустимые символы. Обычно это a-z, 0-9 и "_" или "-". То есть, только прописные буквы латинского алфавита и цифры (как пример). Допустим, нам нужно название статьи в блоге преобразовать в slug для добавления его в URL этой статьи. Как это лучше всего сделать? В Django по умолчанию есть готовая функция slugify для таких случаев. Но я её никогда не использую. Почему? Потому что её недостаточно! Приведём пример >>> from django.utils.text import slugify >>> slugify('This is a Title') 'this-is-a-title' Пока всё отлично >>> slugify('This is a "Title!"') 'this-is-a-title' Спец символы удалились, всё хорошо. >>> slugify('Это заголовок статьи') '' Вот и приехали 😢. Если текст не английский то буквы просто игнорируются. Можно это поправить >>> slugify('Это заголовок статьи', allow_unicode=True) 'это-заголовок-статьи' Но тогда мы не вписываемся в условие. У нас появилась кириллица в тексте. Так как я часто пишу сайты для русскоязычных пользователей эта проблема весьма актуальна. Я не использую стандартную функцию и всегда пишу свою. Оригинал я не беру в расчёт и пишу полностью свою функцию. И так, по порядку: 🔸1. Исходный текст: >>> text = 'Мой заголовок №10 😁!' Взял специально посложней со специальными символами. 🔸2. Транслит Необходимо сделать транслит всех символов в латиницу. Здесь очень выручает библиотека unidecode. Помимо простого транслита кириллицы в латиницу она умеет преобразовывать спец символы и иероглифы в текстовые аналоги. from unidecode import unidecode >>> unidecode("Ñ Σ ® µ ¶ ¼ 月 山") 'N S (r) u P 1/4 Yue Shan' Очень крутая библиотека, советую👍 В нашем случае получаем такое преобразование: >>> text = unidecode(text) >>> print(text) 'Moi zagolovok No. 10 !' Отличный транслит. Смайл просто удалился, хотя я ждал что-то вроде :). Ну и ладно, всë равно невалидные символы. А еще наш код уже поддерживает любой язык, будь то хинди или корейский. 🔸4. Фильтр символов Unidecode не занимается фильтрацией по недопустимым символам. Это мы делаем в следующем шаге через regex. Просто заменим все символы на "_" если они вне указанного диапазона. >>> text = re.sub(r'[^a-zA-Z0-9]+', '_', text) >>> print(text) 'Moi_zagolovok_No_10_' Символ "+" в паттерне выручает когда несколько недопустимых символов идут рядом. Все они заменяются на один символ "_". 🔸5. Slugify Осталось удалить лишние символы по краям и сделать нижний регистр >>> text = text.strip('_').lower() >>> print(text) 'moi_zagolovok_no_10' Получаем отличный slug! 😎 🌎 Полный код в виде функции. ______________ PS. Проверку что в строке остался хоть один допустимый символ я бы вынес в отдельную функцию. #libs#tricks#django

Резултати

Пронајдени 9 слични објави

Пребарај: #graph

当前筛选 #graph清除筛选
404 KIDS SEE GHOSTS (生产力之王版

@Isaiahsystem · Post #1203 · 30.06.2024 г., 07:23

Related Subreddits丨Reddit 探索神器 https://anvaka.github.io/sayit/?query=Nietzsche 最近发现的爆炸网站,Reddit 相关论坛探索,Reddit 关键词图谱。它能根据你给出的任意论坛名字或关键词,编织出整个论坛与之相关的子板图谱,与之关联。点击图谱按钮,再点击弹出的侧边栏子板名字,即可跳转。 网站提到这种图谱关系生成由「发布到此 Subreddit 的用户也发布过的其它板块」决定,并通过 Jaccard Similarity(衡量两个集合相似度的指标)来最终确定板块相似度。 Reddit 作为我 RSS 常驻网站之一,挖掘得比较少,这个网站可以好好用用。它类似前面用过的 music map 以及各种论文网站图谱,详情见下面 refs. 相关链接 1 可视化图谱 2 搜索引擎终极索引 #search#graph#tools

GitHub Trends

@githubtrending · Post #14632 · 25.04.2025 г., 12:00

#python#agents#graph#llms#rag Graphiti helps AI systems handle constantly changing information by building real-time knowledge graphs that track relationships and historical data, allowing them to integrate user interactions, business data, and external sources seamlessly. Unlike traditional methods, it updates information instantly without needing full recomputations, enabling precise historical queries and efficient hybrid searches. This helps AI applications stay context-aware, automate tasks effectively, and manage complex, evolving data with minimal delay. https://github.com/getzep/graphiti

cosplayupload

@cosplayuploadtest2 · Post #102714 · 23.03.2025 г., 03:36

Title: Iori_Sagara_相楽伊織,_GIRLS_graph._デジタル写真集_「泡沫の宵夢」_Set.02 Authors: #None Tags: #None#Iori_Sagara_相楽伊織#Nogizaka46_乃木坂46#デジタル写真集#Iori#Sagara#相楽伊織#GIRLS#graph#デジタル写真集 #「泡沫の宵夢」 #Set #02 recommendation: None TelegraphLinks:page-0-32

cosplayupload

@cosplayuploadtest2 · Post #102682 · 23.03.2025 г., 03:34

Title: Iori_Sagara_相楽伊織,_GIRLS_graph._デジタル写真集_「泡沫の宵夢」_Set.01 Authors: #None Tags: #None#Iori_Sagara_相楽伊織#Nogizaka46_乃木坂46#デジタル写真集#Iori#Sagara#相楽伊織#GIRLS#graph#デジタル写真集 #「泡沫の宵夢」 #Set #01 recommendation: None TelegraphLinks:page-0-28

GitHub Trends

@githubtrending · Post #14649 · 30.04.2025 г., 13:00

#typescript#csv#diagrams#graph#json#nextjs#react#tool#visualization#yaml JSON Crack is a free, open-source tool that instantly turns complex JSON, YAML, CSV, XML, or TOML data into clear, interactive graphs, making it easier to explore and understand your information. It lets you convert between formats, validate data, generate code (like TypeScript interfaces), run queries, and export visuals as images—all while keeping your data private since everything processes locally on your device[1][2][5]. https://github.com/AykutSarac/jsoncrack.com

GitHub Trends

@githubtrending · Post #14878 · 28.06.2025 г., 14:00

#cplusplus#arduino#cansat#csv#embedded#graph#ground_station#iot#microcontroller#network#projects#qt#serial#serial_studio Serial Studio is a free, easy-to-use tool that lets you visualize real-time data from devices like microcontrollers via serial ports, Bluetooth, or network connections. It works on Windows, macOS, and Linux, and offers customizable dashboards with various widgets to monitor sensor data, debug info, or telemetry. You can quickly plot data, export it as CSV for analysis, and even use advanced features like checksum validation and JavaScript data processing. It supports hobbyists, educators, and professionals by simplifying data monitoring and debugging, saving you time and effort in understanding your device’s output. Pro versions add commercial use and extra features[1][4][5]. https://github.com/Serial-Studio/Serial-Studio

GitHub Trends

@githubtrending · Post #15518 · 24.02.2026 г., 11:30

#rust#ai#ai_ocr#attention_mechanism#gnn#gnn_model#gnns#graph#graph_neural_networks#llm_inference#low_latency#mincut#neo4j#ocr#onnx#rust#vector#wasm RuVector is a free, open-source vector database that gets smarter with every query. Unlike static databases, it learns from usage via GNN layers, runs LLMs locally with no cloud costs, supports graph queries like Neo4j, scales freely across nodes, and deploys as a single self-booting file (125ms startup). Run with `npx ruvector`. You benefit from faster, more accurate AI search that improves automatically, zero operating costs, full offline/privacy control, and easy scaling—perfect for RAG, agents, or edge apps without vendor lock-in. https://github.com/ruvnet/ruvector