Datapizza Community 🍕📈
СтатистикаCanale Telegram ufficiale della Datapizza Community📍 👉🏾 https://datapizza.tech/ Contiene fonti, approfondimenti, extra e spunti di discussione sul mondo Tech & AI👩💻👨💻
- Последний пост
- 14 авг.
- Последнее чтение
- 15 авг.
- Постов за неделю
- 6
- Всего постов
- 23
- Тип
- открытый
- Язык
- und
- Категория
- Новости и СМИ (по похожим)
- В каталоге с
- 13 авг.
- 1/24сутки в ленте
- 1 753
- 1/48двое суток
- 2 008
- 1/72трое суток
- 2 166
Оценка по просмотрам недавних постов: пост набирает почти всё за первые сутки.
Посты
Nove modelli frontier messi alla prova sulla ricerca web più difficile mai testata 🔎 DeepWeb-Bench richiede di raccogliere prove massicce da fonti diverse e derivazioni a lungo raggio, molto più complesse dei benchmark esistenti. Dentro troverete: 📌 Solo il 12-14% degli errori dipende dal retrieval, il resto da derivazione e calibrazione 📌 Modelli forti e deboli sbagliano in modi qualitativamente diversi 📌 Accordo tra modelli basso: correlazione di appena ρ = 0,61 📌 Disaccordo per singolo caso fino a 18,8 punti percentuali 📌 Ogni risposta accompagnata da un record di provenienza delle fonti Lo trovate qui 👉 https://arxiv.org/abs/2605.21482
без подписи
Se in questo periodo state cercando nuove opportunità, su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! 🙌 1️⃣ Product Lead in Medicilio 💸 RAL: 50k-75k 💡 Esperienza: 4+ anni 📍 Ibrido su Milano (3 giorni smart-working/settimana) 🙌 Tecnologie: UX/UI Design, AI Fluency, Comunicazione efficace, Product Strategy, Microservizi, Gestione Team, Project management, Regulatory Compliance, SQL 👉 https://bit.ly/4gep7LD 2️⃣ Lead Data Architect in Intarget Group S.r.l. – Società Benefit 💸 RAL: 60k-70k 💡 Esperienza: 5+ anni 📍 Ibrido su Milano, Pisa o Roma 🙌 Tecnologie: Python, SQL, Apache Kafka, GCP, Data Pipeline, Strumenti BI, CI/CD, Terraform 👉 https://bit.ly/4gatYO4 E se avete domande sulle posizioni, noi siamo qui! 🙌
Un framework per testare le vostre applicazioni LLM come fareste con del codice normale 🧪 DeepEval è una libreria open source con decine di metriche pronte per agenti, RAG, chatbot e summarization, con una developer experience in stile Pytest. Dentro troverete: 📌 Metriche: agenti, RAG, chatbot, summarization già pronte all'uso 📌 Integrazione: si collega ai principali framework LLM 📌 Licenza: Apache 2.0, completamente open source 📌 Adozione: oltre 400.000 download mensili Lo trovate qui 👉 https://github.com/confident-ai/deepeval
Un dataset multilingue da mille miliardi di token è online 🌍 Hugging Face ha rilasciato FineTranslations: un dataset di testo parallelo che copre l'inglese e oltre 500 altre lingue, pensato per migliorare la traduzione automatica a minori risorse. Dentro troverete: 📌 La scala: oltre 1000 miliardi di token di testo parallelo 📌 La fonte: contenuti non in inglese di FineWeb2 tradotti con Gemma3 27B 📌 La pipeline: processo di generazione dei dati completamente documentato e riproducibile 📌 L'obiettivo: colmare il divario di qualità nella traduzione verso lingue meno rappresentate 📌 L'uso: pronto per il training e il fine-tuning di modelli di traduzione Vi lasciamo qui il link! 👉 https://huggingface.co/blog/Pclanglais/two-trillion-tokens-open
Un paper per ripensare la memoria degli agenti AI 🤔 I ricercatori propongono Memory in the Loop: un sistema di retrieval in-process che funge da memoria di lavoro estesa per gli agenti linguistici, senza ricorrere a database esterni separati. Dentro troverete: 📌 Il problema: la memoria a lungo termine tradizionale rallenta gli agenti 📌 La soluzione: retrieval integrato direttamente nel processo di inferenza 📌 I vantaggi: meno latenza e più coerenza tra i turni di conversazione 📌 I test: valutazioni su task multi-step che richiedono memoria estesa 📌 Le implicazioni: un possibile standard per gli agenti di nuova generazione Ecco a voi il link! 👉 https://arxiv.org/abs/2607.05690
Se in questo periodo state cercando nuove opportunità, su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! 🙌 1️⃣ Lead Data Architect in Intarget Group S.r.l. - Società Benefit 💸 RAL: 60k-70k 💡 Esperienza: 5+ anni 📍 Ibrido a Milano, Pisa o Roma 🙌 Tecnologie: Python, SQL, Apache Kafka, GCP, Data Pipeline, Strumenti BI, CI/CD, Terraform 👉 https://bit.ly/4giJbO4 2️⃣ AI Transformation Leader in AzzurroDigitale 💸 RAL: 60k-80k 💡 Esperienza: 5+ anni 📍 Ibrido a Padova 🙌 Tecnologie: AI Expert, Evaluation di soluzioni GenAI, RAG e Agenti, Sistemi multi-agente, AI Tools, People Management, Project management 👉 https://bit.ly/3TyV7mb E se avete domande sulle posizioni, noi siamo qui! 🙌
Portare l'AI in azienda sembra facile. Poi provate a farlo davvero e scoprite quante cose si possono rompere. Un anno di Adoption ci ha insegnato dove serve attenzione, persone, processi, tempi. E cosa serve perché il cambiamento resti in piedi. In questa live troverete: 📌 Casi reali, 📌 Cose imparate sul campo 📌 Nessuna teoria da slide E se vi siete mai chiesti com'è lavorare su questo lato di Datapizza, qui potrete trovare le risposte. Speaker: Giacomo Ciarlini, Co-Founder and CIO Luca Malinverno, Head of AI Adoption 📅 Giovedì 6 agosto, alle ore 17:00 📍 In diretta su LinkedIn & Youtube Trovate qui sotto i link per seguire la diretta! 👇 Linkedin: https://www.linkedin.com/events/comesiportal-aidentroun-azienda7488858835395297281/theater/ Youtube: https://www.youtube.com/live/ifDvXD2G7Sg?si=c17nRqUO8HQ0m4tu
Un agente che decide da solo come strutturare il proprio ragionamento 🧠 I ricercatori dell'University of Washington propongono Deep Reasoning, un metodo per costruire scaffold di ragionamento su misura per ogni task, invece di usare pattern fissi. Dentro troverete: 📌 Un linguaggio formale per rappresentare il meta-ragionamento 📌 Combinazione di inferenza associativa, calcolo formale e scomposizione ricorsiva 📌 DOLORES: l'agente generale che applica il metodo in pratica 📌 Task complessi distribuiti su thread di ragionamento più piccoli e controllati 📌 Dipendenze tra sotto-problemi preservate durante l'esecuzione Lo trovate qui 👉 https://arxiv.org/abs/2605.11388
Le AI imparano davvero dai propri errori? ❌ Epoch AI ha lanciato EBR-bench: fa giocare ai modelli frontier lo stesso gioco da tavolo complesso, Earthborne Rangers, per 30 partite di fila. Il risultato mette in discussione una delle promesse più ripetute sull'apprendimento continuo. Dentro troverete: 📌 Setup: modelli valutati su 30 playthrough consecutivi dello stesso gioco 📌 Risultato: nessun segno di miglioramento, nemmeno con una guida strategica completa 📌 Confronto: performance ben sotto quella di giocatori umani esperti 📌 Implicazioni: dubbi concreti sulla capacità di apprendimento on-the-fly dei modelli attuali Lo trovate qui 👉 https://epoch.ai/publications/earthborne-rangers-benchmark
Un benchmark per capire se gli agenti sanno davvero fare code review 🦀 c-CRAB è il nuovo dataset pensato per valutare quanto gli agenti AI siano affidabili quando devono analizzare pull request reali, non solo scrivere codice da zero. Dentro troverete: 📌 Task: revisione di pull request reali su repository di produzione 📌 Metriche: precisione nel trovare bug, stile e problemi di design 📌 Confronto: gap ancora ampio tra agenti e reviewer umani 📌 Dataset: pensato per essere riusabile su nuovi modelli e agenti Lo trovate qui 👉 https://arxiv.org/abs/2603.23448
Quanto è cambiata l’AI dal 2023 ad oggi? 🤔 Nel 2023 gli agenti AI completavano da soli compiti di pochi minuti. Oggi si avvicinano alle 12 ore! ⌛️ Un esempio concreto: "organizzami la giornata di domani". Nel 2023 ricevevate una lista di consigli generici. Oggi un agente legge il calendario, le email, nota i conflitti, riorganizza le priorità e vi presenta un piano pronto da approvare (e senza il bisogno di saper scrivere una riga di codice 👀) C'è però un problema: questi agenti lavorano appoggiandosi a provider fuori dall'Europa. La domanda quindi non è più "come lo costruisco", ma "a chi affido i miei dati?" 🔐 Proprio per questo, Fastweb + Vodafone hanno lanciato ROSS: un agente AI che vive su Telegram, con i dati elaborati interamente in Europa, conforme a GDPR e AI Act 🇮🇹 Gestisce email, agenda, ricerche e documenti al posto vostro e soprattutto: nessun dato viene usato per addestrare altri modelli. Per scoprire cosa ROSS può fare per voi, eccovi il link 👉 https://bit.ly/4g1n6U1
Vediamo insieme le nuove scoperte di Anthropic che per l'ennesima volta ci fanno ricredere su quanto credevamo di sapere. 📌 Cosa sappiamo davvero su perché funzionano gli LLM? 📌 Le nuove evidenze suggeriscono che i modelli possono pensare ? 📌 E quindi sono coscienti? (no, ma capiamo insieme il perché) Ne parliamo in live con: Manuel Vimercati, Direttore Scientifico Irene Senatore, AI Adoption Specialist 🗓️ Giovedì 30 luglio, ore 18:00 📍 In diretta su LinkedIn e YouTube Assisti alla live qui 👇 LinkedIn: https://www.linkedin.com/events/maquindil-aipensa7488129138034302976/theater/ YouTube: https://www.youtube.com/live/SpKqngVzDt0?si=WWmepIrU2BGhk9Ch
Se in questo periodo state cercando nuove opportunità, su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! 🙌 1️⃣ Flutter developer in Rosso 💸 RAL: 28k-32k 💡 Esperienza: 0-1 anni 📍 Ibrido a Lucca 🙌 Tecnologie: Dart, Mobile development, Flutter, Frontend, Firebase, CI/CD, Testing 👉 https://bit.ly/3TqmnDg 2️⃣ Cyber Security Expert / Specialist in Credem 💸 RAL: 50k-65k 💡 Esperienza: 3+ anni 📍 In sede a Reggio Emilia o Milano 🙌 Tecnologie: Cyber Security, Sicurezza applicativa, EntraID, SOC, Network Security, Identity Management, Azure Security, SonarQube, Splunk, IAM/PAM, Azure, AWS 👉 https://bit.ly/4bm9Mam E se avete domande sulle posizioni, noi siamo qui! 🙌
Quanto conta il contesto giusto per un coding agent? 🔍 ContextBench misura la capacità degli agenti di recuperare esattamente le informazioni rilevanti da una codebase, invece di affogare in contesto inutile. Dentro troverete: 📌 Obiettivo: valutare il context retrieval nei coding agent 📌 Metodo: task su codebase reali con informazioni sparse tra più file 📌 Risultato: molti agenti recuperano contesto ridondante o incompleto 📌 Uso: benchmark riproducibile per testare nuove strategie di retrieval Lo trovate qui 👉 https://arxiv.org/abs/2602.05892
Il primo "Tribunale di Internet" europeo potrebbe essere Italiano! 🇮🇹 L'11 giugno è stato depositato in Senato un disegno di legge per creare sezioni specializzate in materia digitale nei tribunali italiani: giudici formati per gestire cause su cloud, software, AI, piattaforme e dati. La motivazione della proposta: troppe decisioni su controversie digitali vengono prese da chi non ha competenza tecnica specifica sulla materia. ⚖️ Il risultato è che cause complesse su backup, cloud o AI finiscono ridotte a semplice inadempimento contrattuale generico, senza che la tecnologia coinvolta venga capita. Se venisse approvato, l'Italia sarebbe il primo Paese in Europa con giudici specializzati in materia digitale! 💻 Ora il testo passa all'iter parlamentare, ma la proposta organica esiste già (e potete approfondirla qui 👉 https://shorturl.at/d0WSB ) Secondo voi sarà efficace? 💬
без подписи
Se in questo periodo state cercando nuove opportunità, su Datapizza Jobs abbiamo due posizioni che potrebbero interessarvi! 🙌 1️⃣ AI Tech Lead in Azienda Finanziaria Italiana 💸 RAL: 55k-65k 💡 Esperienza: 4-6 anni 📍 Milano, Bologna o Torino (sede primaria Milano) 🙌 Tecnologie: RAG, Python, Agenti, Machine Learning, AI, GenAI, Claude Code 👉 https://bit.ly/4vMxLXz 2️⃣ Solution Software Architect in Imatra 💸 RAL: 70k-80k 💡 Esperienza: 6+ anni 📍 Ibrido a Rimini 🙌 Tecnologie: .NET, C#, PostgreSQL, Cloud, CI/CD, Docker, Kubernetes, React, Mobile development 👉 https://bit.ly/4yH6xo2 E se avete domande sulle posizioni, noi siamo qui! 🙌
PwC ha analizzato 1 miliardo di offerte di lavoro sull'impatto dell'AI 📈 Il Global AI Jobs Barometer 2026 copre 27 Paesi e raccoglie i dati più concreti su come l'intelligenza artificiale sta ridisegnando il mercato del lavoro globale. Dentro potrete trovare: 📌 Chi cresce di più: i lavoratori con alta esposizione all'AI avanzano 3x più velocemente 📌 Come si suddivide il mercato: due percorsi distinti, chi si adatta e chi resta indietro 📌 I settori più colpiti: analisi granulare per industria e tipo di mansione 📌 I dati su tutti e 27 i Paesi: benchmark internazionale reale, senza stime approssimative Lo potete trovare a questo link 👉 https://www.pwc.com/gx/en/services/ai/ai-jobs-barometer.html
E se fosse il modello stesso a decidere quando riassumere la propria memoria? 🧠 SelfCompact propone un approccio in cui l'agente decide autonomamente quando comprimere il contesto accumulato, invece di farlo a intervalli fissi o attendere che sia l'utente a richiederlo. In questo paper troverete: 📌 Un tool di compattazione che il modello invoca da solo 📌 Una rubrica che dice quando comprimere e quando invece aspettare 📌 Fino a 18,1 punti in più su task di matematica rispetto al baseline 📌 5-9 punti in più su ricerca agentica, con costi ridotti del 30-70% 📌 Ricerca firmata Johns Hopkins University e Apple Lo trovate qui 👉 https://arxiv.org/abs/2606.23525